匿名霸榜一周后,智谱 GLM-5.3-Flash 揭晓,能力追平 Opus 4.8,价格有惊喜
匿名霸榜一周后,智谱 GLM-5.3-Flash 揭晓,能力追平 Opus 4.8,价格有惊喜 一周前,OpenRouter 上悄没声地多了个模型,叫 Ox Alpha,中文社区管它叫"牛来"。 没人知道它是谁家的。但它上来就不讲道理,几天在 OpenRouter 烧掉 23 万亿 Token,
💡 你将学到
匿名霸榜一周后,智谱 GLM-5.3-Flash 揭晓,能力追平 Opus 4.8,价格有惊喜 一周前,OpenRouter 上悄没声地多了个模型,叫 Ox Alpha,中文社区管它叫"牛来"。 没人知道它是谁家的。但它上来就不讲道理,几天在 OpenRouter 烧掉 23 万亿 Token,
匿名霸榜一周后,智谱 GLM-5.3-Flash 揭晓,能力追平 Opus 4.8,价格有惊喜
一周前,OpenRouter 上悄没声地多了个模型,叫 Ox Alpha,中文社区管它叫"牛来"。
没人知道它是谁家的。但它上来就不讲道理,几天在 OpenRouter 烧掉 23 万亿 Token,又在 OpenCode 上把 DeepSeek 连庄 56 天的榜首抢了下来。两个平台的调用量第一,都是它。
8 月 26 日晚 9 点,智谱出来认领。Ox Alpha 就是 GLM-5.3-Flash,GLM-5 系列第一个原生多模态模型,权重直接开源。
其实揭晓之前,社区已经根据分词器特征、推理参数和 API 报错习惯三项交叉比对,99% 押注是智谱。我跟了这整整一周,把团队日常的活都切给它跑了一遍。结论很简单。这东西一头追平 Opus 4.8 的能力,一头比涨价后的 DeepSeek V4 Flash 还便宜,两头都没给对手留位置。
从匿名到揭晓,这一周发生了什么
8 月 20 日,Ox Alpha 以匿名身份出现在 OpenRouter。
8 月 26 日 21 点,智谱正式上线并开源 GLM-5.3-Flash。
中间这七天,全球开发者用脚投票。OpenCode 上,它六天处理 42 万亿 Token,单日用量创下平台纪录,是此前峰值的 4 倍。智谱还公布了一个更狠的细节,Ox Alpha 期间的全部调用流量跑在 10 万张国产芯片上,华为、海光、摩尔线程,没有用一张英伟达 GPU。
我拿它干了三件事
代码。 我把一个内部项目的脚手架需求同时交给 GLM-5.3-Flash、GLM-5.3 和 Claude Opus 4.8,让三家各写一版。Flash 一次成型,代码结构的清晰度反而超过了 GLM-5.3。
图像理解。 我丢给它一张带玻璃立方体效果的海报,让它用 Three.js 复刻。它自己认出了 MeshPhysicalMaterial,就是 Three.js 里专门模拟玻璃、金属这类真实材质的模块,全套参数自己填好了,折射率 1.44、色散 1.0、清漆层 1,还顺手加了胶片颗粒着色器和一层蓝色薄雾。这种活,以前只有最贵的闭源模型能干。
综合能力。 第三方评测平台 Artificial Analysis 的智能指数,它拿到 57 分,和 Opus 4.8 持平。这个分数放在以前意味着两难,要么按 Opus 4.8 的价格掏钱,要么忍受 DeepSeek V4 Flash 8 月涨价之后的"便宜但能力受限"。
GLM-5.3-Flash 把这个两难拆了。
百万 Token 四毛钱
| 模型 | 输入(元/百万 token) | 输出(元/百万 token) |
|---|---|---|
| GLM-5.3-Flash(限时折扣) | 0.4 | 1.4 |
| GLM-5.3-Flash(标准) | 0.8 | 2.8 |
| GLM-5.3 | 8 | 28 |
| DeepSeek V4 Flash(涨价后谷时) | 1.5 | 4.5 |
| Claude Opus 4.8 | 约 35 | 约 175 |
限时折扣到 9 月 9 日 24 点截止,之后回到 0.8 元和 2.8 元。即便恢复原价,它还是比 DeepSeek V4 Flash 便宜一档,是 GLM-5.3 标准价的十分之一。
智谱在发布稿里写了一句话:"同样智力,1/40 价格,前沿智能,第一次不需要省着用。"
我对着价格表算了一遍,这话没夸张。
便宜的底气在架构
GLM-5.3-Flash 总参数 320B,每次推理只激活 18B。作为对比,GLM-4.5 总参数 355B、激活 32B。激活规模小了快一半,性能反而压过 GLM-5 系列此前的型号。
底气来自三个架构改动。稀疏注意力加线性注意力的混合架构,让模型不用每个字都互相对一遍,注意力计算量降到原来的三分之一。流形约束超连接(mHC)重构了网络连接方式。KV 缓存,就是显存里存放对话上下文的那块空间,压缩到原来的 22% 左右。
再加上 30T Token 的多模态语料预训练,它原生就能吃文本、图像和视频。视觉能力还融进了写代码的过程,做前端、做游戏、搭 Blender 3D 场景,它会主动看一眼渲染结果,再接着改。
去哪用
三个入口都已经上架。
智谱 BigModel 开放平台,API 直接调,按 Token 计费。Z Code 是智谱自研的编程智能体,新用户送 5 天,每天 500 万 Token。GLM Coding Plan 是订阅制,Lite、Pro、Max 三档,新版改积分制,工作日下午 2 点到 6 点高峰段按标准积分扣,其余时间半价。
权重在 Hugging Face 同步上线,MIT 协议,国产卡能跑,想本地部署的可以直接下。
我的建议
如果你的主力是 DeepSeek V4 Flash,涨价之后大概率已经在找下家。如果是 Opus 4.8,那个价格个人开发者很难放开用。GLM-5.3-Flash 是这一周里,唯一一个在 57 分这档能力上,把门槛砍到四毛钱的方案。
我自己已经把日常任务切过去了。
这里是鹏叔大玩家。 Ox Alpha 这一周的测试先告一段落。接下来我会盯着它在 OpenCode 和 OpenRouter 上的真实调用量,10 万张国产芯片扛不扛得住长上下文,9 月初见分晓。
你现在用哪个国产模型替 Opus 4.8?评论区聊聊。
本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。
