以后买 CPU 自带 AI 算力了,AMD 和 Intel 联手制定新标准
🩺 摘要
以后买 CPU 自带 AI 算力了,AMD 和 Intel 联手制定新标准 AMD 和 Intel 联手了。 不是营销合作,不是联合搞个芯片组规格——两家 x86 死对头在 x86 生态系统咨询组(EAG) 名下,一起定义了一套全新的 AI 指令集,叫 ACE(AI Compute Extens
📝 详情
以后买 CPU 自带 AI 算力了,AMD 和 Intel 联手制定新标准
AMD 和 Intel 联手了。
不是营销合作,不是联合搞个芯片组规格——两家 x86 死对头在 x86 生态系统咨询组(EAG) 名下,一起定义了一套全新的 AI 指令集,叫 ACE(AI Compute Extensions)。
最新规范 v1.15 已经发布。它的核心一句话概括:把矩阵乘法引擎直接塞进 CPU 核心里。
16 倍密度碾压,但不是取代 GPU
先说 ACE 做了什么。
现在的 CPU 跑 AI 计算,靠的是 AVX(高级矢量扩展)指令集。但它有个硬伤:矩阵乘法需要大量的乘-加操作,AVX 的标量和矢量单元干这个活效率很低,算力密度上不去。
ACE 的办法是加一套全新的 tile(瓦片)寄存器和外积运算单元,专门干矩阵乘法。
跟 AVX10 深度绑定——ACE 的输入输出直接走 AVX10 的矢量寄存器,ACE 只负责矩阵乘这块最吃算力的环节。一个 ACE 外积操作的计算密度是等效 AVX10 乘-加操作的 16 倍,功耗还不增加。
但别误会。它不是要取代 GPU。 分析师 Jim McGregor 说得很透:CPU 永远不会比 GPU/AI 加速器更高效。ACE 的真正价值在于那些没法装独显和 NPU 的场景——嵌入式设备、边缘计算、轻薄本。
一口气支持 11 种数据格式
ACE v1 规格里列了 11 种数据格式,覆盖了当下 AI 推理用的主流低精度格式:
- 基础格式:INT8、INT32、FP32、FP16、BF16
- OCP MX 格式:MX FP8、MX FP6、MX FP4、MX INT8
- 专用格式:E8M0(无符号 8 位指数,用于 block scaling)、FP8(OCP OFP8 规范)
什么意思?就是 ACE 能直接理解 AI 模型推理时用的量化权重格式。模型里的 FP8、MX FP4 这类数据,不需要先转换成 FP32 再算,ACE 原生支持,直接算。
这对推理效率和内存带宽都是实打实的提升。
最快的 2028 年,别着急换机
那什么时候能用上?
按目前已知的路线图:第一波 ACE-v1 处理器最早 2028 年。
- AMD Zen 6 和 Intel Nova Lake 两家的路线图上都没提到 ACE
- AMD 在 Zen 7 的规划里提到了一个新 "Matrix Engine"——大概率就是 ACE
- Intel 这边还没有对应的产品代号
也就是说,ACE 不是未来一两年的东西。现在买 Zen 6 或 Arrow Lake 的新 CPU,是吃不到 ACE 红利的。等 Zen 7 那一代。
对比一下竞争对手:ARM 的 SME2(可伸缩矩阵扩展)已经落地——Apple M4 和 Qualcomm Snapdragon X2 都用上了。x86 在 AI 指令集上确实落后了,但 ACE 至少让 AMD 和 Intel 站在了同一条起跑线上。
对普通用户意味着什么
说人话版:
如果你只打游戏、上网、跑 Office——ACE 跟你没关系。 你的工作负载用不到矩阵乘法。
如果你跑本地 AI 模型(LLM 推理、Stable Diffusion、本地 RAG)——ACE 会有用。 但前提是你的 CPU 支持 ACE,而且软件生态跟上。2028 年之前别指望。
如果你是做嵌入式/边缘 AI 开发的——ACE 是个值得关注的信号。 它意味着未来在无 GPU 的 x86 设备上跑 AI 推理,CPU 自己就能扛了。
另外还有一个容易被忽略的点:ACE 由 AMD 和 Intel 联合定义,意味着 同一个 AI 代码在两家的 CPU 上跑,结果一致,不需要分别优化。这在 x86 历史上是第一次。以前 AMD 用 AVX2、Intel 用 AVX-512,生态各走各的,开发者两边都得伺候。ACE 把这个割裂补齐了。
个人观点:x86 的"合围"比 ACE 本身更重要
ACE v1 的规格说不上惊艳。支持的格式多,但基本都是现在行业已经用起来的(MX FP4/FP6/FP8 都是 OCP 标准)。计算密度 16 倍于 AVX10,但 ARM SME2 的 M4 芯片已经在跑路了。
我觉得真正重要的不是 ACE 有多强,而是谁在推它。
AMD 和 Intel 两家历史上的死对头,因为 ARM 和 RISC-V 的压力,坐到了同一张桌子前。除了 ACE,EAG 还搞了 FRED(灵活返回指令)、AVX10(统一 AVX 生态)、ChkTag(内存安全标签)、APX(高级性能扩展)——全部是联合定义,统一落地。
这个"合围"姿态,比单一指令集的性能数字更有信号意义。x86 从未像现在这样碎片化过(看看 AVX-512 在不同代 Intel 芯片上的混乱局面),也从未像现在这样在 AI 上落后过。ACE 的 16 倍密度不是答案,统一生态、降低开发者成本,才是 x86 应对 ARM 挑战的真正底牌。
评论区见
所以问题来了:ACE 能把 x86 拉回 AI 赛道的牌桌吗?还是说等你真正买到支持 ACE 的 CPU 时,ARM 侧已经跑了一个代际的差距?你是等等 Zen 7,还是直接投向 M 系列或骁龙 X 了?
以后买 CPU 自带 AI 算力了,AMD 和 Intel 联手制定新标准
AMD 和 Intel 联手了。
不是营销合作,不是联合搞个芯片组规格——两家 x86 死对头在 x86 生态系统咨询组(EAG) 名下,一起定义了一套全新的 AI 指令集,叫 ACE(AI Compute Extensions)。
最新规范 v1.15 已经发布。它的核心一句话概括:把矩阵乘法引擎直接塞进 CPU 核心里。
16 倍密度碾压,但不是取代 GPU
先说 ACE 做了什么。
现在的 CPU 跑 AI 计算,靠的是 AVX(高级矢量扩展)指令集。但它有个硬伤:矩阵乘法需要大量的乘-加操作,AVX 的标量和矢量单元干这个活效率很低,算力密度上不去。
ACE 的办法是加一套全新的 tile(瓦片)寄存器和外积运算单元,专门干矩阵乘法。
跟 AVX10 深度绑定——ACE 的输入输出直接走 AVX10 的矢量寄存器,ACE 只负责矩阵乘这块最吃算力的环节。一个 ACE 外积操作的计算密度是等效 AVX10 乘-加操作的 16 倍,功耗还不增加。
但别误会。它不是要取代 GPU。 分析师 Jim McGregor 说得很透:CPU 永远不会比 GPU/AI 加速器更高效。ACE 的真正价值在于那些没法装独显和 NPU 的场景——嵌入式设备、边缘计算、轻薄本。
一口气支持 11 种数据格式
ACE v1 规格里列了 11 种数据格式,覆盖了当下 AI 推理用的主流低精度格式:
- 基础格式:INT8、INT32、FP32、FP16、BF16
- OCP MX 格式:MX FP8、MX FP6、MX FP4、MX INT8
- 专用格式:E8M0(无符号 8 位指数,用于 block scaling)、FP8(OCP OFP8 规范)
什么意思?就是 ACE 能直接理解 AI 模型推理时用的量化权重格式。模型里的 FP8、MX FP4 这类数据,不需要先转换成 FP32 再算,ACE 原生支持,直接算。
这对推理效率和内存带宽都是实打实的提升。
最快的 2028 年,别着急换机
那什么时候能用上?
按目前已知的路线图:第一波 ACE-v1 处理器最早 2028 年。
- AMD Zen 6 和 Intel Nova Lake 两家的路线图上都没提到 ACE
- AMD 在 Zen 7 的规划里提到了一个新 "Matrix Engine"——大概率就是 ACE
- Intel 这边还没有对应的产品代号
也就是说,ACE 不是未来一两年的东西。现在买 Zen 6 或 Arrow Lake 的新 CPU,是吃不到 ACE 红利的。等 Zen 7 那一代。
对比一下竞争对手:ARM 的 SME2(可伸缩矩阵扩展)已经落地——Apple M4 和 Qualcomm Snapdragon X2 都用上了。x86 在 AI 指令集上确实落后了,但 ACE 至少让 AMD 和 Intel 站在了同一条起跑线上。
对普通用户意味着什么
说人话版:
如果你只打游戏、上网、跑 Office——ACE 跟你没关系。 你的工作负载用不到矩阵乘法。
如果你跑本地 AI 模型(LLM 推理、Stable Diffusion、本地 RAG)——ACE 会有用。 但前提是你的 CPU 支持 ACE,而且软件生态跟上。2028 年之前别指望。
如果你是做嵌入式/边缘 AI 开发的——ACE 是个值得关注的信号。 它意味着未来在无 GPU 的 x86 设备上跑 AI 推理,CPU 自己就能扛了。
另外还有一个容易被忽略的点:ACE 由 AMD 和 Intel 联合定义,意味着 同一个 AI 代码在两家的 CPU 上跑,结果一致,不需要分别优化。这在 x86 历史上是第一次。以前 AMD 用 AVX2、Intel 用 AVX-512,生态各走各的,开发者两边都得伺候。ACE 把这个割裂补齐了。
个人观点:x86 的"合围"比 ACE 本身更重要
ACE v1 的规格说不上惊艳。支持的格式多,但基本都是现在行业已经用起来的(MX FP4/FP6/FP8 都是 OCP 标准)。计算密度 16 倍于 AVX10,但 ARM SME2 的 M4 芯片已经在跑路了。
我觉得真正重要的不是 ACE 有多强,而是谁在推它。
AMD 和 Intel 两家历史上的死对头,因为 ARM 和 RISC-V 的压力,坐到了同一张桌子前。除了 ACE,EAG 还搞了 FRED(灵活返回指令)、AVX10(统一 AVX 生态)、ChkTag(内存安全标签)、APX(高级性能扩展)——全部是联合定义,统一落地。
这个"合围"姿态,比单一指令集的性能数字更有信号意义。x86 从未像现在这样碎片化过(看看 AVX-512 在不同代 Intel 芯片上的混乱局面),也从未像现在这样在 AI 上落后过。ACE 的 16 倍密度不是答案,统一生态、降低开发者成本,才是 x86 应对 ARM 挑战的真正底牌。
评论区见
所以问题来了:ACE 能把 x86 拉回 AI 赛道的牌桌吗?还是说等你真正买到支持 ACE 的 CPU 时,ARM 侧已经跑了一个代际的差距?你是等等 Zen 7,还是直接投向 M 系列或骁龙 X 了?
💬 评论 (0)