国产大模型赢了!GLM-5.2霸榜Design Arena,开源碾压闭源
🩺 摘要
国产大模型赢了!GLM-5.2霸榜Design Arena,开源碾压闭源 6 月 12 号下午,Anthropic 刚发布 3 天的 Fable 5 被美国政府一刀切,全球外国用户全断联。 6 月 16 号,Design Arena 排行榜更新:GLM-5.2 以 1360 Elo 登顶代码类第
📝 详情
国产大模型赢了!GLM-5.2霸榜Design Arena,开源碾压闭源
6 月 12 号下午,Anthropic 刚发布 3 天的 Fable 5 被美国政府一刀切,全球外国用户全断联。
6 月 16 号,Design Arena 排行榜更新:GLM-5.2 以 1360 Elo 登顶代码类第一,超过了已经不可用的 Claude Fable 5。
前后 4 天。
这不是巧合。这是智谱过去一年的产品节奏,恰好撞上了地缘政治制造的市场真空。
01. Design Arena 是什么?为什么这个排名重要?
Design Arena 是目前全球最大的 AI 设计盲测平台,来自 190 多个国家和地区的数百万真实用户投票打分。
它测的不是那种"调个 API 写个 hello world"的代码能力。它让你写前端界面、做全栈应用、跑游戏开发——然后真人用户看效果投票。
盲测的意思是:投票者不知道是哪家模型生成的,只看结果。 这个机制比任何官方自报的 benchmark 都更有说服力。
在代码分类下,GLM-5.2(Max 模式)拿下了 1360 Elo 分,比上期跃升了 4 个名次,涨了 27 个 Elo 点。
排在它后面的模型:Claude Opus 4.7(Thinking)、Gemini 3.5 Flash、Kimi K2.6——都是各大厂的最强旗舰。
这意味着什么?
这些都不是随便凑数的模型。在真实用户盲测的环境下,GLM-5.2 的审美和编码能力,被全球用户判定为第一。
02. Fable 5 的消失,和 GLM-5.2 的出现
Fable 5 是 Anthropic 第一款向公众开放的 Mythos 级模型,上线 72 小时就因为美国出口管制被叫停——包括 Anthropic 自己公司里的外籍员工也不能用。
智谱的发布时机踩得很准。
6 月 13 日 17:21(刚好是 Fable 5 被断联的 24 小时后),GLM-5.2 全量开放:
- 753B 参数(MoE 架构,推理时只激活部分参数)
- 1M 无损上下文——不是参数表上一个更大数字,是真的能在 100 万 token 里精准找到月初的日志行号
- MIT 开源协议——你能下载权重、本地部署、二次开发、商用
- Coding Plan 全量用户可用——Lite、Pro、Max、Team 版同步开放
- 已在华为昇腾、摩尔线程等国产算力平台完成适配
第三方 KingBench 3 测试拿到 81.43 分,仅次于 Opus 4.8 和 Fable 5。
而且价格是 Fable 5 的几分之一。
03. 1M 上下文不是噱头,是真能用的
模型圈有个潜规则:上下文的"宣称值"和"实际值"是两码事。
很多模型过了 25 万 token 就开始失忆。越长越慢,越慢越贵,没人真敢用到 100 万。
GLM-5.2 的 1M 上下文,有几个开发者实测算出了真东西:
- 4 小时长程任务:自己写代码、组 29 个 review 智能体从 4 个维度挑毛病、揪出 18 个 bug 全修掉、跑 Headless Chrome 自动化测试——中间没人插手,17 万 token 状态全攥在手里不丢
- 日志溯源:把一整月的服务器日志塞进去,它能精确引用到月初的原始行号和时戳,把连接池满载 → 慢性积累 → 503 级联的因果链串起来
- 物理模拟:让它跑 2D 粒子模拟,切换轨道模式后规则全套换——引力怎么算、碰撞怎么处理、粒子要不要合并,三种模式各自干净
说白了,大上下文不是参数表上多一位数,而是让模型能一口气吃掉整个项目,从头干到尾不丢东西。
04. 开源 vs 闭源:这是真正改变游戏规则的
Fable 5 被封这件事,暴露了整个闭源 API 行业的一个致命弱点:你的模型是租来的,不是买来的。
你花了几周时间基于 Fable 5 构建产品,结果它一夜之间就从你的 API 请求里消失了。
GLM-5.2 的解法是:MIT 开源协议。权重在 HuggingFace 上就能下,你可以本地部署、私有化运行、二次开发商用。
没有人能远程关停你的模型——因为它就装在你自己的服务器上。
这个道理在 Fable 5 被下架之前,很多开发者只是"知道";Fable 5 下架之后,他们是"感受到"了。
当一个中国模型的 CEO 说出「前沿智能,不该只属于少数人,也不该被少数规则随时收回」的时候——这句话在 6 月 12 号之前是一句漂亮的 PR 文案,6 月 12 号之后是一句锋利的判断。
05. 个人观点:GLM-5.2 不一定是你见过最强的模型,但它可能是你最能放心用的
我不用急着吹它打平了 Opus 4.8 或者超越了 GPT-5.5。
因为那些话在模型测评圈里每天都在说,真正的问题是——明天这个模型还在吗?
Fable 5 在位三天就出局了,你说它强不强?强。有用吗?对全球外国用户来说,没用。
GLM-5.2 在这个节点登顶 Design Arena,最大的价值不是 1360 的 Elo 分数——而是它给了你第二个选择。
这个选择来自一个在过去一年里保持了稳定发布节奏(3 月 GLM-5.1、5 月高速版、6 月 5.2)、API 价格只有海外旗舰几分之一、而且开源权重在你手里的团队。
如果你的团队正在做前端开发、设计工具、或者任何需要调用模型的业务,我建议你把 GLM-5.2 加进你的 API 轮询列表里。不是因为它一定最好,而是因为它不会突然消失。
评论区来聊
Fable 5 被下架这件事,有没有让你重新考虑"用闭源模型构建产品"的风险?
你现在的前端开发工作流里,主力用哪家模型?会不会考虑把 GLM-5.2 换进去?
欢迎评论区说说。
国产大模型赢了!GLM-5.2霸榜Design Arena,开源碾压闭源
6 月 12 号下午,Anthropic 刚发布 3 天的 Fable 5 被美国政府一刀切,全球外国用户全断联。
6 月 16 号,Design Arena 排行榜更新:GLM-5.2 以 1360 Elo 登顶代码类第一,超过了已经不可用的 Claude Fable 5。
前后 4 天。
这不是巧合。这是智谱过去一年的产品节奏,恰好撞上了地缘政治制造的市场真空。
01. Design Arena 是什么?为什么这个排名重要?
Design Arena 是目前全球最大的 AI 设计盲测平台,来自 190 多个国家和地区的数百万真实用户投票打分。
它测的不是那种"调个 API 写个 hello world"的代码能力。它让你写前端界面、做全栈应用、跑游戏开发——然后真人用户看效果投票。
盲测的意思是:投票者不知道是哪家模型生成的,只看结果。 这个机制比任何官方自报的 benchmark 都更有说服力。
在代码分类下,GLM-5.2(Max 模式)拿下了 1360 Elo 分,比上期跃升了 4 个名次,涨了 27 个 Elo 点。
排在它后面的模型:Claude Opus 4.7(Thinking)、Gemini 3.5 Flash、Kimi K2.6——都是各大厂的最强旗舰。
这意味着什么?
这些都不是随便凑数的模型。在真实用户盲测的环境下,GLM-5.2 的审美和编码能力,被全球用户判定为第一。
02. Fable 5 的消失,和 GLM-5.2 的出现
Fable 5 是 Anthropic 第一款向公众开放的 Mythos 级模型,上线 72 小时就因为美国出口管制被叫停——包括 Anthropic 自己公司里的外籍员工也不能用。
智谱的发布时机踩得很准。
6 月 13 日 17:21(刚好是 Fable 5 被断联的 24 小时后),GLM-5.2 全量开放:
- 753B 参数(MoE 架构,推理时只激活部分参数)
- 1M 无损上下文——不是参数表上一个更大数字,是真的能在 100 万 token 里精准找到月初的日志行号
- MIT 开源协议——你能下载权重、本地部署、二次开发、商用
- Coding Plan 全量用户可用——Lite、Pro、Max、Team 版同步开放
- 已在华为昇腾、摩尔线程等国产算力平台完成适配
第三方 KingBench 3 测试拿到 81.43 分,仅次于 Opus 4.8 和 Fable 5。
而且价格是 Fable 5 的几分之一。
03. 1M 上下文不是噱头,是真能用的
模型圈有个潜规则:上下文的"宣称值"和"实际值"是两码事。
很多模型过了 25 万 token 就开始失忆。越长越慢,越慢越贵,没人真敢用到 100 万。
GLM-5.2 的 1M 上下文,有几个开发者实测算出了真东西:
- 4 小时长程任务:自己写代码、组 29 个 review 智能体从 4 个维度挑毛病、揪出 18 个 bug 全修掉、跑 Headless Chrome 自动化测试——中间没人插手,17 万 token 状态全攥在手里不丢
- 日志溯源:把一整月的服务器日志塞进去,它能精确引用到月初的原始行号和时戳,把连接池满载 → 慢性积累 → 503 级联的因果链串起来
- 物理模拟:让它跑 2D 粒子模拟,切换轨道模式后规则全套换——引力怎么算、碰撞怎么处理、粒子要不要合并,三种模式各自干净
说白了,大上下文不是参数表上多一位数,而是让模型能一口气吃掉整个项目,从头干到尾不丢东西。
04. 开源 vs 闭源:这是真正改变游戏规则的
Fable 5 被封这件事,暴露了整个闭源 API 行业的一个致命弱点:你的模型是租来的,不是买来的。
你花了几周时间基于 Fable 5 构建产品,结果它一夜之间就从你的 API 请求里消失了。
GLM-5.2 的解法是:MIT 开源协议。权重在 HuggingFace 上就能下,你可以本地部署、私有化运行、二次开发商用。
没有人能远程关停你的模型——因为它就装在你自己的服务器上。
这个道理在 Fable 5 被下架之前,很多开发者只是"知道";Fable 5 下架之后,他们是"感受到"了。
当一个中国模型的 CEO 说出「前沿智能,不该只属于少数人,也不该被少数规则随时收回」的时候——这句话在 6 月 12 号之前是一句漂亮的 PR 文案,6 月 12 号之后是一句锋利的判断。
05. 个人观点:GLM-5.2 不一定是你见过最强的模型,但它可能是你最能放心用的
我不用急着吹它打平了 Opus 4.8 或者超越了 GPT-5.5。
因为那些话在模型测评圈里每天都在说,真正的问题是——明天这个模型还在吗?
Fable 5 在位三天就出局了,你说它强不强?强。有用吗?对全球外国用户来说,没用。
GLM-5.2 在这个节点登顶 Design Arena,最大的价值不是 1360 的 Elo 分数——而是它给了你第二个选择。
这个选择来自一个在过去一年里保持了稳定发布节奏(3 月 GLM-5.1、5 月高速版、6 月 5.2)、API 价格只有海外旗舰几分之一、而且开源权重在你手里的团队。
如果你的团队正在做前端开发、设计工具、或者任何需要调用模型的业务,我建议你把 GLM-5.2 加进你的 API 轮询列表里。不是因为它一定最好,而是因为它不会突然消失。
评论区来聊
Fable 5 被下架这件事,有没有让你重新考虑"用闭源模型构建产品"的风险?
你现在的前端开发工作流里,主力用哪家模型?会不会考虑把 GLM-5.2 换进去?
欢迎评论区说说。
💬 评论 (0)