ROCm 10 发布:推理性能翻 3.3 倍,AMD 终于开始拼开发体验了
ROCm 10 发布:推理性能翻 3.3 倍,AMD 终于开始拼开发体验了 8 月 28 日,AMD 发布了 ROCm 10。这个版本刚好赶上 ROCm 十周年——第一版 ROCm 1.0 是 2016 年 4 月发布的。 十年时间,ROCm 从一个勉强能用的 CUDA 替代品,走到了一个方向明
💡 你将学到
ROCm 10 发布:推理性能翻 3.3 倍,AMD 终于开始拼开发体验了 8 月 28 日,AMD 发布了 ROCm 10。这个版本刚好赶上 ROCm 十周年——第一版 ROCm 1.0 是 2016 年 4 月发布的。 十年时间,ROCm 从一个勉强能用的 CUDA 替代品,走到了一个方向明
ROCm 10 发布:推理性能翻 3.3 倍,AMD 终于开始拼开发体验了
8 月 28 日,AMD 发布了 ROCm 10。这个版本刚好赶上 ROCm 十周年——第一版 ROCm 1.0 是 2016 年 4 月发布的。
十年时间,ROCm 从一个勉强能用的 CUDA 替代品,走到了一个方向明确的转折点。这次 ROCm 10 的重点不再是"我们又多了几个底层库",而是一整套叫 ROCm.AI 的开发工具链,目标很直接:让在 AMD 显卡上跑 AI 这件事,不再那么折腾。
ROCm.AI 是什么
ROCm.AI 由三个部分组成,各管一段。
ROCm CLI 是一个统一的命令行工具。以前装 ROCm 要跑一堆脚本,环境变量配错一个地方就全盘崩。现在一个 rocm serve <模型名> 就能把模型拉起来做推理,rocm examine 自动诊断驱动和环境问题。还支持离线环境,可以把依赖打成自包含包带走。不过这东西目前还是技术预览版,接口以后会变,别当成稳定工具依赖。
AMD Skills 是把 AMD 官方验证过的 ROCm 知识做成技能包,直接塞进 Claude、Cursor、Codex 这些 AI 编程助手里。以前你问 AI"怎么在 AMD 卡上优化推理",它大概率给你编一套 CUDA 的方案。现在这些助手能调用 AMD 官方的技能目录,回答会靠谱很多。技能包放在 GitHub 的 amd/skills 仓库里,一条命令就能装。
Hyperloom 是三个里面最有想象力的。它是一个开源的自动化优化系统,自己跑性能分析、找瓶颈、改代码、改 GPU kernel、验证效果,然后循环往复。AMD 说过去工程师要花几周做的优化工作,Hyperloom 几小时就能跑完,而且能尝试的方案比人在时间压力下敢试的多得多。简单说就是用 AI 给 AI 工作负载调优。
性能数字怎么看
AMD 给出的数字是:相比 ROCm 7,推理吞吐提升 3.3 倍,训练提升 2.4 倍。
这个数字要拆开看。
测试平台是 Instinct MI355X 8 卡,跑的模型是 GLM-5、Kimi-K2.5、DeepSeek-R1-0528,测试时间是 2026 年 7 月 7 日,由 AMD Performance Labs 完成。数据来源是 AMD 自己,不是第三方实测。
更关键的是对比基线是 ROCm 7,不是上一代 ROCm 9。ROCm 7 是 2024 年初的版本,中间隔了 ROCm 8、9 两个大版本。3.3 倍是跨了三年多的累积提升,不是从 ROCm 9 到 10 一代就翻了三倍。
还有一点:测试用的是数据中心的 MI355X,消费级 Radeon 显卡能拿到多少提升,AMD 没有给数据。用 RX 系列跑本地大模型的用户,别直接把 3.3 倍套到自己的卡上。
对普通用户意味着什么
ROCm 10 支持的硬件范围比以前宽:Instinct 加速器、Radeon 消费级显卡、Ryzen 核显,全产品线覆盖,Windows 和 Linux 都支持。
这意味着两件事。
第一,AMD 显卡跑 AI 的门槛在降低。ROCm CLI 把安装和启动简化了,AMD Skills 让 AI 助手能给出靠谱的 AMD 平台建议,Hyperloom 则把最头疼的性能优化自动化了。这三件事叠在一起,对"想在 AMD 卡上跑大模型但不想折腾环境"的用户是实质性的改善。
第二,AMD 的策略变了。过去几年 ROCm 的思路是"CUDA 有什么我们就补什么",底层库一个个追,但开发体验一直是短板——装不上、跑不起来、性能上不去,这三个问题劝退了很多人。ROCm 10 不再只拼库的数量,开始拼整个工作流的顺畅度。这个方向是对的。
但别太乐观
有几个现实问题要说清楚。
ROCm CLI 还是技术预览,Hyperloom 刚开源,AMD Skills 依赖第三方 AI 助手的技能生态成熟度。这三个东西都还在早期,离"开箱即用"还有距离。
消费级显卡的支持一直是 ROCm 的软肋。虽然官方说 Radeon 全系列支持,但实际体验上,很多用户还是会遇到驱动兼容、模型不支持、性能不如预期的问题。ROCm 10 有没有改善这一点,需要等社区实测。
还有一个根本问题:CUDA 的生态优势不是靠工具链就能追平的。几乎所有 AI 框架和模型默认先支持 CUDA,ROCm 永远在后面适配。ROCm.AI 能降低使用门槛,但改变不了"先有 CUDA 版,才有 ROCm 版"这个现实。
我的判断
ROCm 10 是 AMD 在 AI 软件栈上的一次思路切换。
从 ROCm 1 到 9,AMD 在补底层,追的是"CUDA 能做的我也能做"。ROCm 10 开始追的是"用起来比 CUDA 省事"。这个切换本身比 3.3 倍的性能数字更重要——性能可以靠硬件迭代堆,开发体验的差距才是用户留不下来的根本原因。
对已经在用 AMD 显卡跑 AI 的人,ROCm 10 值得升级试试,尤其是 ROCm CLI 和 Hyperloom。对还在观望、纠结买 N 卡还是 A 卡的人,ROCm 10 是个积极信号,但还不足以成为切换阵营的核心理由。等消费级显卡的实测出来再下结论不迟。
本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。
