DeepSeek V4 Flash 正式版上线,便宜版居然赢了贵版?
DeepSeek V4 Flash 正式版上线,便宜版居然赢了贵版? 今天早上 7 点,DeepSeek 在 X 上发了条消息,AI 圈直接炸了—— V4-Flash 正式版 API,上线公测了。 听起来就是普通的版本更新?但看到官方那张跑分图,很多懂行的人都愣住了: 9 项 AI 干活能力
💡 你将学到
DeepSeek V4 Flash 正式版上线,便宜版居然赢了贵版? 今天早上 7 点,DeepSeek 在 X 上发了条消息,AI 圈直接炸了—— V4-Flash 正式版 API,上线公测了。 听起来就是普通的版本更新?但看到官方那张跑分图,很多懂行的人都愣住了: 9 项 AI 干活能力
DeepSeek V4 Flash 正式版上线,便宜版居然赢了贵版?
今天早上 7 点,DeepSeek 在 X 上发了条消息,AI 圈直接炸了——
V4-Flash 正式版 API,上线公测了。
听起来就是普通的版本更新?但看到官方那张跑分图,很多懂行的人都愣住了:
9 项 AI 干活能力测试,便宜版全部超过了贵版的预览版。
打个比方:你买了辆经济型轿车,结果 0-100 加速比那辆贵三倍的运动版还快。
这事,值得好好聊聊。
先说结论:便宜版赢了贵版
DeepSeek 的模型有两个版本:
- Flash(闪电版):便宜、快,定位是"够用就行"
- Pro(专业版):更大、更强,定位是"干硬活"
按常理,Pro 应该全面碾压 Flash。但这次正式版的跑分出来——Flash 在所有 9 项测试里,分数全部超过了 Pro 的预览版。
这不是"小进步",这是"经济型反超了豪华版"。
到底变了什么?答案是:换了套"精装修"
别急着脑补"DeepSeek 又搞了什么黑科技"。
这次更新,模型的大脑结构一个参数都没动。
还是那套配置:
- 总共 2840 亿参数,但每次只激活 130 亿(专业说法叫 MoE,通俗讲就是"大团队、精兵出击")
- 能一口气读完 100 万字的长文
- 三档思考模式:不思考 / 深度思考 / 拉满思考
跟之前预览版一模一样。那到底变了什么?
变的是"后训练"——你可以理解为"精装修"。
同样一栋楼,毛坯房和精装修住起来天差地别。模型也一样:大脑结构(毛坯)没变,但训练方式(装修)升级了,出来的效果就完全不同。
跑分到底差多少?一张表看懂
DeepSeek 这次很大方,把测试数据全贴出来了。我帮你翻译成"人话版":
| 考试科目 | 便宜版 Flash | 贵版预览 Pro | 差距 |
|---|---|---|---|
| 终端操作 | 82.7 | 72.1 | +10.6 |
| 代码仓库重建 | 54.2 | 38.5 | +15.7 |
| 网络安全实操 | 76.7 | 52.7 | +24.0 |
| 软件开发 | 54.4 | 12.8 | +41.6 |
| 工具使用 | 70.3 | 55.9 | +14.4 |
| 综合大考 | 25.2 | 16.5 | +8.7 |
| 自动化测试 | 25.1 | 12.8 | +12.3 |
| 全栈开发 | 68.7 | 41.8 | +26.9 |
| 高难度开发 | 59.6 | 31.1 | +28.5 |
最炸裂的是"软件开发"这一行:便宜版 54.4 分,贵版预览才 12.8 分——直接甩了 41.6 分。
什么概念?就像考试从"勉强及格"直接跳到"年级前几名",而且还是花钱少的那个考的。
更厉害的是,便宜版整体水平已经超过了 GLM 5.2,部分成绩甚至逼近了 Claude Opus 4.8——目前最强的选手之一。
下面这张就是 DeepSeek 官方今天早上贴的跑分图:
但是,先别急着吹——三个"坑"要说清楚
跑分好看归好看,但有几个"但是"你得知道。
第一个坑:这套分数不是"裸考"考出来的。
官方用了自家的一套答题工具(叫 DeepSeek Harness),还没开源。也就是说,这是"带着最佳装备考的试",你自己拿模型去跑,未必能复现这个分数。
第二个坑:有两科是"自家出的题"。
全栈开发和高难度开发这两项,是 DeepSeek 自己内部的题库,外人没法验证。分数可以参考,但别当圣旨。
第三个坑:真正好不好用,还得看实际项目。
官方跑分是"实验室条件",你的项目是"野外生存"。两者之间,差着一整个真实世界。
这事跟你有什么关系?
分两种情况说。
如果你是普通用户(平时用 ChatGPT、DeepSeek 网页版聊聊天):
这次更新跟你没关系。它只改了 API 接口,手机端和网页端没动,体验和昨天一模一样。该聊天聊天,该写代码写代码。
如果你是开发者(用 DeepSeek 跑 AI Agent 做项目):
那有三件事,值得认真想想——
第一,该重新评估"选贵版还是便宜版"了。
以前大家默认上 Pro,因为便宜版干不了复杂活——"软件开发"那科才 7.3 分,压住了很多人。现在直接跳到 54.4 分,以前选 Pro 的项目,该拿便宜版重新跑一轮测试了。能省的不只是钱,还有几倍的等待时间。
第二,官方跑分是"天花板",不是"地板"。
带着最佳装备考的分数,你自己在项目里大概能跑出一半就算不错。但就算一半,也比之前的 Pro 预览版强,值得切换。
第三,真正的大招可能还在后面。
官方说那套答题工具(Harness)即将开源,而更贵的 Pro 正式版也"敬请期待"。如果这两个时间点对得上——那才是真正的大招。
至于 Pro 正式版的消息,今天没有同步更新,但官方给出了"敬请期待"的悬念,相信应该不远了。
鹏叔的建议
一句话落地:这周之内,拿便宜版跑一两个不重要的任务试试水。
成绩稳定,再考虑换到核心项目上。至于 Pro 正式版——8 月初它的 API 会更新,而且大概率会带上那套开源工具。等 Pro 的人,等的就是这个。
最后说句心里话:DeepSeek 这波操作让我看到一个趋势——AI 模型的竞争,已经从"谁更大"变成了"谁更会训练"。 同样的大脑结构,训练方法不同,效果天差地别。
这对咱们普通人是好事:模型越卷,价格越低,能力越强。
你觉得这波 DeepSeek 能打几分?评论区聊聊👇
本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。
