"3B 打平 600B"——我看完新浪论文后,沉默了 5 分钟
title: "3B 打平 600B"——我看完新浪论文后,沉默了 5 分钟 date: 2026-06-29 platform: toutiao status: finalized cover: cover.png "3B 打平 600B"——我看完新浪论文后,沉默了 5 分钟 昨天,新浪(对
title: "3B 打平 600B"——我看完新浪论文后,沉默了 5 分钟 date: 2026-06-29 platform: toutiao status: finalized cover: cover.png
"3B 打平 600B"——我看完新浪论文后,沉默了 5 分钟
昨天,新浪(对,就是门户那个新浪)把一个 3B 参数的小模型开源了,叫 VibeThinker-3B。
先说几个数字你品品——在 AIME26 这个数学奥赛难度的基准上,它接近了 DeepSeek V3.2、Qwen3-235B 这帮参数量是它 200 到 333 倍的大模型;在 LeetCode 竞赛题上,它解决了 123/128 道,把 GPT-5.2、Kimi K2.5 都甩在身后。
注意:我说的是"接近",不是"打平"。
标题党最爱这俩字——"3B 干翻 600B"——但你把数据铺开看,事情完全不是那么回事。
1. VibeThinker-3B 到底是个什么东西
不是新浪从零训的。它的底子是阿里 Qwen2.5-Coder-3B,3B 参数,专门为代码和推理微调过的基座。
新浪做的事,是给它做了"三阶段后训练": - SFT(监督微调):先用高质量数学/代码题教它"一步一步想" - 强化学习:让模型在自我对弈中"刷分",奖励正确答案 - 自蒸馏:把模型自己做的多解法题提炼成训练数据
这三步不是新浪独创的——DeepSeek R1、Qwen3 都做过。但新浪的赌注是:只做后训练、不动基座,3B 也能刷到顶。
2. 4 个基准的"真相"——3 涨 1 崩
直接摆数据(来源:The Decoder 报道 + 新浪官方卡):
| 基准 | VibeThinker-3B | 对手 | 结论 |
|---|---|---|---|
| AIME26(数学奥赛) | 接近顶部 | DeepSeek V3.2、Qwen3-235B(200-333 倍参数) | 接近,但没明确超越 |
| LiveCodeBench(实时编码) | 超越 | 所有 20B 以下模型 | 真的小模型 SOTA |
| LeetCode 竞赛 | 123/128 | GPT-5.2、Kimi K2.5 | 实战题甩开顶级大模型 |
| GPQA-Diamond(知识推理) | 大幅落后 | 任何主流大模型 | 知识盲区炸裂 |
看到没?"3 涨 1 崩"——它在逻辑推理类任务上能跟 600B 掰手腕,但在知识密集型任务上还是个文盲。
这就是新浪那篇论文的核心发现,他们起了一个名字叫"参数压缩-覆盖假说": - 逻辑推理依赖少数可压缩模式(几步推理路径,蒸馏来蒸馏去就是那些)→ 3B 装得下 - 世界知识是百科全书式的覆盖("二战哪年结束""元素周期表第 51 位是什么")→ 3B 装不下,得靠大参数
这意味着什么:3B 模型在"思考"层面可以追平大模型,但在"知道"层面永远是个小学生。别看到"3B 干翻 600B"就激动去买小模型——你让它解释"特朗普第二任期内阁改组",它还是会胡说。
顺手补一个细节,让"3 涨 1 崩"这张表更有抓手——
- AIME26 是什么:美国数学邀请赛(American Invitational Mathematics Examination)的延伸题集,被 AI 圈当作"奥数难度推理"的硬尺,VibeThinker-3B 在这上面能追平 600B 级别,说明逻辑链压缩这条路真的走通了
- GPQA-Diamond 是什么:博士级科学问答基准,覆盖物理/化学/生物等高门槛知识,3B 大幅落后是因为这类题需要先"知道"才能"推理"——这恰好印证了"知识不能压缩"的假说
- LeetCode 123/128 是什么:算法竞赛实战题,这才是开发者最关心的"能不能用"指标——3B 在这里干翻 GPT-5.2,是个真信号
3. 大白话总结:跟我有什么关系?
如果你是开发者: - 本地装得下:3B 模型在消费级显卡(比如 4090)上能跑 30+ token/秒——手机都能跑 - 场景适配:写代码辅助、做数学题辅助、做算法题辅助 → 选 VibeThinker-3B - 别用的场景:写新闻、写综述、需要"知道"很多事实的任务 → 选大模型
如果你是普通用户: - 这个月你用不到:开源是给开发者玩的,离你手机里的豆包、Kimi 还远 - 但你手机的未来被它改写:3B 能本地推理,意味着未来手机、智能家居、汽车都能跑"会思考的 AI",不用每句话都上传到云——这个方向比 VibeThinker-3B 本身重要一百倍
如果你是 AI 行业观察者: - 小模型路线正式从"探索"进入"成熟"——DeepSeek R1 蒸馏小模型、Qwen3 出小尺寸、Llama 3.2 1B/3B、Phi-4 mini、现在新浪 VibeThinker——头部玩家全部在押注"小而精" - 大模型路线不会死,但通用大模型+垂直小模型的组合会成主流
4. 我的判断
我有个反共识判断——
"3B 干翻 600B"是个营销话术,新浪真正想说的根本不是"小模型奇迹"。
新浪想说的是:未来 5 年,你手机里、车里、家电里跑的 AI,不会是云端 600B 模型的简化版——它会是一个专门为"思考"优化的、本地跑的 3B 小模型。
这背后是算力主权的争夺:
- 现在所有 AI 都在云端跑 → 英伟达赚得盆满钵满,普通人每次问 AI 都要付钱
- 未来 3B 模型本地化 → 算力下沉到终端,AI 推理成本归零,新场景爆炸
VibeThinker-3B 是这条路线的里程碑事件,不是"小模型奇迹"。
而且你要知道——VibeThinker-3B 是开源的,MIT 协议。这意味着任何手机厂商、家电厂商、汽车厂商都可以直接拿去用,不用付授权费。这是 DeepSeek V3/R1 之后,中国公司第二次在"模型平权"上给全球打了个样。
5. 评论区聊聊
问个事儿:
你愿意让你手机里本地跑一个 3B 的"小 AI"(反应快、不联网、隐私安全,但知识可能没云端全),还是继续用云端大模型(知识全,但要联网、要花钱、可能泄隐私)?
评论区聊聊——你更在意"快+隐私"还是"全+智能"?
