GLM-5.3 刚开源一周,腾讯 770B 的 Hy4 就追上来了
GLM-5.3 刚开源一周,腾讯 770B 的 Hy4 就追上来了 这周国产大模型打得有点凶。 8 月 27 日,智谱把 GLM-5.3-Flash 开源了,跑分追平 Opus 4.8,百万 token 报价四毛钱,我昨天还专门写了一篇。结果第二天,8 月 28 日,腾讯混元就甩出了新一代旗舰模
💡 你将学到
GLM-5.3 刚开源一周,腾讯 770B 的 Hy4 就追上来了 这周国产大模型打得有点凶。 8 月 27 日,智谱把 GLM-5.3-Flash 开源了,跑分追平 Opus 4.8,百万 token 报价四毛钱,我昨天还专门写了一篇。结果第二天,8 月 28 日,腾讯混元就甩出了新一代旗舰模
GLM-5.3 刚开源一周,腾讯 770B 的 Hy4 就追上来了
这周国产大模型打得有点凶。
8 月 27 日,智谱把 GLM-5.3-Flash 开源了,跑分追平 Opus 4.8,百万 token 报价四毛钱,我昨天还专门写了一篇。结果第二天,8 月 28 日,腾讯混元就甩出了新一代旗舰模型 Hy4,770B 参数、1M 上下文,同样开源,价格同样压得很低。
但我注意到一个细节:腾讯这次没怎么晒跑分榜,晒的是一份"盲测"。
腾讯这次不晒跑分,晒了一份盲测
按腾讯混元官方博客的说法,他们找了内部 163 名专家,设计了 203 个真实工程任务,让 Hy4、GLM 5.3、Kimi K3 三个模型在代码、办公、科学这三类活儿里同台干。专家不知道答案来自哪个模型,按 4 分制打分。
结果是 Hy4 均分 2.99,Kimi K3 是 2.94,GLM 5.3 是 2.92。
这个赢法很微妙。对比 GLM 5.3,Hy4 的胜率是 46.8%,平局 12.8%,输了 40.4%。说"略优"很准确,说"碾压"就属于吹牛了。
为什么大厂开始不爱晒跑分榜了(评价体系之争)
benchmark(就是那些公开的标准化考试题)这两年有个越来越明显的毛病:题目是公开的,模型训练时很容易"刷"到类似的题,分数越考越高,放到真实工作里却未必好使。这跟学生应试一个道理,模考次次满分,真上项目不一定扛得住。
腾讯这次换了个思路:干脆不考标准题,直接从内部真实业务里捞任务出来——写代码、做表格、搞科研计算,让天天干这些活儿的专家盲着打分。模型到底好不好用,干过活儿的人说了算。
这套评价方式比跑分榜更接近你我用模型的真实场景,但它也有自己的局限:测试是腾讯自家组织的,专家是腾讯的人,任务是腾讯挑的,对比的 GLM 和 Kimi 是当前线上版本。它能说明 Hy4 在腾讯的生产力场景里表现不错,至于"国内第一"这种结论,还得等更多独立测试来验证。
硬规格和价格(限时免费)
简单交代下参数。Hy4 是 MoE 架构(混合专家,可以理解成一个模型里装了好多个专科大脑,每次只调用对口的那几个),总参数 770B,每次激活 49B,上下文 1M——一百万 token,差不多能一次性塞进去一整部长篇小说。上一代 Hy3 是 295B 总参、21B 激活、256K 上下文,各项规格等于翻了一倍多。
API 定价每百万 token:缓存命中输入 0.3 元,正常输入 6 元,输出 18 元。模型权重在 GitHub、HuggingFace 等四个平台开源。
跟发布同步还有个实在福利:腾讯的 AI 办公助手 WorkBuddy 已经上线 Hy4,8 月 28 日到 9 月 10 日限时免费,这期间不花 token 钱就能直接上手;上一代 Hy3 的免费期也延长到了 9 月 30 日。元宝、ima 这些 App 里同样能免费用。
官方还很坦诚地先认了个错:这是 preview 预览版,复杂任务上会"想太多"、反复自我检查,正式版还在迭代。
选型逻辑变了:从看分数到看活儿
把这周两件事放一起看,趋势很清楚:智谱晒的是公开跑分追平海外旗舰,腾讯晒的是内部盲测略超国内对手。两套打法,一个在证明"我不比国外差",一个在证明"我干真实的活更强"。
对我们普通用户来说,真正的好消息是国产开源模型卷到这个程度,强的越来越强,价格越来越低,选择越来越多。跑分榜单看看就好,能不能帮你写完那段代码、做完那张表,才是实打实的。
在 2026 年的今天,你平时用大模型干活吗?国产模型跟 GPT、Claude 比起来,你觉得差距还有多大?评论区聊聊。
本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。
