DeepSeek V4 Flash 正式版上线,便宜版居然赢了贵版?

📡 AI新闻 2026-08-27 约 1 分钟阅读

DeepSeek V4 Flash 正式版上线,便宜版居然赢了贵版? 今天早上 7 点,DeepSeek 在 X 上发了条消息,AI 圈直接炸了—— V4-Flash 正式版 API,上线公测了。 听起来就是普通的版本更新?但看到官方那张跑分图,很多懂行的人都愣住了: 9 项 AI 干活能力

💡 你将学到

DeepSeek V4 Flash 正式版上线,便宜版居然赢了贵版? 今天早上 7 点,DeepSeek 在 X 上发了条消息,AI 圈直接炸了—— V4-Flash 正式版 API,上线公测了。 听起来就是普通的版本更新?但看到官方那张跑分图,很多懂行的人都愣住了: 9 项 AI 干活能力

📜 目录

DeepSeek V4 Flash 正式版上线,便宜版居然赢了贵版?

今天早上 7 点,DeepSeek 在 X 上发了条消息,AI 圈直接炸了——

V4-Flash 正式版 API,上线公测了。

听起来就是普通的版本更新?但看到官方那张跑分图,很多懂行的人都愣住了:

9 项 AI 干活能力测试,便宜版全部超过了贵版的预览版。

打个比方:你买了辆经济型轿车,结果 0-100 加速比那辆贵三倍的运动版还快。

这事,值得好好聊聊。

先说结论:便宜版赢了贵版

DeepSeek 的模型有两个版本:

按常理,Pro 应该全面碾压 Flash。但这次正式版的跑分出来——Flash 在所有 9 项测试里,分数全部超过了 Pro 的预览版。

这不是"小进步",这是"经济型反超了豪华版"。

到底变了什么?答案是:换了套"精装修"

别急着脑补"DeepSeek 又搞了什么黑科技"。

这次更新,模型的大脑结构一个参数都没动。

还是那套配置:

跟之前预览版一模一样。那到底变了什么?

变的是"后训练"——你可以理解为"精装修"。

同样一栋楼,毛坯房和精装修住起来天差地别。模型也一样:大脑结构(毛坯)没变,但训练方式(装修)升级了,出来的效果就完全不同。

跑分到底差多少?一张表看懂

DeepSeek 这次很大方,把测试数据全贴出来了。我帮你翻译成"人话版":

考试科目 便宜版 Flash 贵版预览 Pro 差距
终端操作 82.7 72.1 +10.6
代码仓库重建 54.2 38.5 +15.7
网络安全实操 76.7 52.7 +24.0
软件开发 54.4 12.8 +41.6
工具使用 70.3 55.9 +14.4
综合大考 25.2 16.5 +8.7
自动化测试 25.1 12.8 +12.3
全栈开发 68.7 41.8 +26.9
高难度开发 59.6 31.1 +28.5

最炸裂的是"软件开发"这一行:便宜版 54.4 分,贵版预览才 12.8 分——直接甩了 41.6 分。

什么概念?就像考试从"勉强及格"直接跳到"年级前几名",而且还是花钱少的那个考的。

更厉害的是,便宜版整体水平已经超过了 GLM 5.2,部分成绩甚至逼近了 Claude Opus 4.8——目前最强的选手之一。

下面这张就是 DeepSeek 官方今天早上贴的跑分图:

但是,先别急着吹——三个"坑"要说清楚

跑分好看归好看,但有几个"但是"你得知道。

第一个坑:这套分数不是"裸考"考出来的。

官方用了自家的一套答题工具(叫 DeepSeek Harness),还没开源。也就是说,这是"带着最佳装备考的试",你自己拿模型去跑,未必能复现这个分数。

第二个坑:有两科是"自家出的题"。

全栈开发和高难度开发这两项,是 DeepSeek 自己内部的题库,外人没法验证。分数可以参考,但别当圣旨。

第三个坑:真正好不好用,还得看实际项目。

官方跑分是"实验室条件",你的项目是"野外生存"。两者之间,差着一整个真实世界。

这事跟你有什么关系?

分两种情况说。

如果你是普通用户(平时用 ChatGPT、DeepSeek 网页版聊聊天):

这次更新跟你没关系。它只改了 API 接口,手机端和网页端没动,体验和昨天一模一样。该聊天聊天,该写代码写代码。

如果你是开发者(用 DeepSeek 跑 AI Agent 做项目):

那有三件事,值得认真想想——

第一,该重新评估"选贵版还是便宜版"了。

以前大家默认上 Pro,因为便宜版干不了复杂活——"软件开发"那科才 7.3 分,压住了很多人。现在直接跳到 54.4 分,以前选 Pro 的项目,该拿便宜版重新跑一轮测试了。能省的不只是钱,还有几倍的等待时间。

第二,官方跑分是"天花板",不是"地板"。

带着最佳装备考的分数,你自己在项目里大概能跑出一半就算不错。但就算一半,也比之前的 Pro 预览版强,值得切换。

第三,真正的大招可能还在后面。

官方说那套答题工具(Harness)即将开源,而更贵的 Pro 正式版也"敬请期待"。如果这两个时间点对得上——那才是真正的大招。

至于 Pro 正式版的消息,今天没有同步更新,但官方给出了"敬请期待"的悬念,相信应该不远了。

鹏叔的建议

一句话落地:这周之内,拿便宜版跑一两个不重要的任务试试水。

成绩稳定,再考虑换到核心项目上。至于 Pro 正式版——8 月初它的 API 会更新,而且大概率会带上那套开源工具。等 Pro 的人,等的就是这个。


最后说句心里话:DeepSeek 这波操作让我看到一个趋势——AI 模型的竞争,已经从"谁更大"变成了"谁更会训练"。 同样的大脑结构,训练方法不同,效果天差地别。

这对咱们普通人是好事:模型越卷,价格越低,能力越强。

你觉得这波 DeepSeek 能打几分?评论区聊聊👇

相关文章
2026-08-15
昨天那个把 Agent 跑上头条的人,今天因为 Agent 上头条了
2026-08-17
自动化红队,是 AI 走向生产环境必须跨过的一道坎。
2026-08-23
AI 真的开上 F-16 了:不是模拟器,不是无人机,是实打实的战斗机

本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论