DeepSeek 新模型能看图了,但真正重要的不是它追上了谁

📡 AI新闻 2026-09-06 约 1 分钟阅读

DeepSeek 新模型能看图了,但真正重要的不是它追上了谁 今天早上刷到 DeepSeek 发新模型,我第一反应是:"哦,又一个能看图的。" 读完官方文档和跑分表,我改了看法。 这次的关键不在"能看图"这三个字。能看图的模型现在一抓一大把,GPT 能看,Claude 能看,Gemini 也能

💡 你将学到

DeepSeek 新模型能看图了,但真正重要的不是它追上了谁 今天早上刷到 DeepSeek 发新模型,我第一反应是:"哦,又一个能看图的。" 读完官方文档和跑分表,我改了看法。 这次的关键不在"能看图"这三个字。能看图的模型现在一抓一大把,GPT 能看,Claude 能看,Gemini 也能

📜 目录

DeepSeek 新模型能看图了,但真正重要的不是它追上了谁

今天早上刷到 DeepSeek 发新模型,我第一反应是:"哦,又一个能看图的。"

读完官方文档和跑分表,我改了看法。

这次的关键不在"能看图"这三个字。能看图的模型现在一抓一大把,GPT 能看,Claude 能看,Gemini 也能看。DeepSeek 这次真正的动作是:把自家最便宜的 V4-Flash 加上视觉,然后把它直接放进了多模态 Agent 的战场,对标的是 Anthropic 的 Claude Opus 4.8。

一个能"看见屏幕"的便宜模型(视觉能力上线)

先说这个模型到底能干什么。

DeepSeek-V4-Flash-Vision-Exp,名字长了点,拆开看就是三层:V4-Flash 是 DeepSeek 最便宜的主力文本模型,Vision 是加了视觉,Exp 表示这是实验版本。它现在能读 base64 图片、外网图片 URL,也能通过新出的 Files API 用 file_id 引用图片。

听起来还是技术词。我给你翻一下:以后你写 Agent 脚本,扔给它一张电脑屏幕截图,它能看懂截图里哪个按钮在哪、报错信息写了什么、表格里哪一列数字不对,然后调用相应的工具去操作。再比如你扔一张财报图表,它能读出柱状图之间的差值,不用你手动把数字敲进去。

这才是"长眼睛"对 Agent 真正的意义。过去大半年我玩过不少 Agent 框架,最大的痛点之一就是它们只能读文字。你让它操作一个网页,它得靠 HTML 源码去猜页面长什么样;网页一改版,或者内容是 canvas 渲染的,它就抓瞎。能看懂截图之后,Agent 面对的就是一个人类操作员看到的同一张屏幕。

384 个 token 一张图(价格才是 DeepSeek 的老规矩)

视觉模型以前不是没有,但贵。

DeepSeek 这次的定价规则是:每张图片最多折算 384 个 token,按 V4-Flash 的价格走。V4-Flash 什么价位?第三方研究机构本月测过,处理一百万词大约 0.87 美元,而 Anthropic 同级模型大概要 50 美元。差了将近 60 倍。

同步上线的 Files API 还免费。你上传一次图片,拿到一个 file_id,后面多次请求直接引用就行,不用每次重复传。这对批量任务特别关键,比如每天要分析一万张用户截图的客服系统,光带宽费就能省一截。

所以你看,跑分对比只是表层。真正会让企业开发者认真考虑这个模型的,是"差一点"和"差 60 倍价钱"之间那道算术题。

11 项基准赢了 3 项(数据得摊开看)

官方给了 11 项多模态 Agent 基准测试,我替你把账算清楚。

V4-Flash-Vision-Exp 赢过 Opus 4.8 的有 3 项:DeepSWE 高 1.3 分,Agents' Last Exam 高 1.6 分,ZeroBench 高 1.0 分。

打平或者差一点点的有 Toolathlon-Verified(75.9 对 76.2)、Chartography(64.3 对 65.0)、Terminal Bench 2.1(83.9 对 85.0)。

落后比较多的是两项:NL2Repo 是 57.7 对 69.7,差了 12 分;DSBench-Hard 是 63.6 对 71.7,差了 8 分。这两项都是那种"给你一个完整代码仓库,自己找问题、自己修"的硬核任务。

我一直奉劝身边做 Agent 的朋友,看跑分别只看厂商挑出来宣传的那一两项。DeepSeek 这次还算克制,整张表都放出来了,赢得输得写得明明白白。你要做的是对照自己的场景:如果你跑的是网页操作、图表解析、终端任务这一档,差距基本就在一两分内;如果你的产品核心是仓库级代码重构,那 12 分的差距可能就是能不能上线的区别。

Exp 这三个字母别忽略(实验版的边界)

有几个细节得说清楚,不然容易被二手标题带偏。

第一,模型名里的 Exp 是 experimental 的意思。DeepSeek 自己标注为实验版本,意味着接口可能改、稳定性可能波动,生产环境要谨慎上。

第二,它对标的是 Opus 4.8,这是 Anthropic 5 月发布的模型,目前还在服役期。但 Anthropic 7 月 24 日已经发布了更新的 Claude Opus 5。DeepSeek 这张表里没有 Opus 5,全网目前也没人做过这组对比。"接近 Claude"这话没错,但准确说法是接近 Claude Opus 4.8,不是追上 Anthropic 最新旗舰。

第三,官方表里有个脚注挺诚实:纯文本的 V4-Flash 在多模态测试里是"忽略图片内容"硬考的。这听起来像废话,但说明跑分差距有一部分是因为老模型根本看不见图。新模型加上眼睛之后分数跳升,ApexBench 从 26.2 涨到 36.5,Agents' Last Exam 从 25.2 涨到 27.3,这个涨幅是真实的,但你得知道它从什么基线涨上来的。

反过来说,DeepSeek 还透露了一个数据:在 7 项纯文本基准里,视觉版有 6 项反而比纯文本版分数高,Toolathlon 涨 5.6 分、DeepSWE 涨 4.9 分。加一双眼睛没把原来的本事丢掉,这点工程上确实下了功夫。

我的判断(视觉 Agent 价格战开打)

Harness 0.1.1 跟模型同一天发,这件事我觉得比跑分更值得说一句。

Harness 是 DeepSeek 自家的 Agent 框架,定位类似 OpenAI 的 Codex SDK。新模型第一天就被框架原生支持,意味着 DeepSeek 想给你的是一整套:便宜模型、视觉能力、Agent 编排框架,三件事打包。改一行 model 参数,原本读文字的 Agent 就能看截图,这个接入门槛已经被压得很低。

我之前写过 DeepSeek V4-Flash 正式版那波,它在 Agent 跑分上反超自家 Pro 版的时候,我判断 DeepSeek 会把"Flash 级别价格 + Pro 级别能力"作为长期打法。现在看,这个打法又往前推了一步:Flash 价格 + 多模态 + Agent 框架,三件事凑齐了。

对我们这些天天跟 Agent 打交道的人来说,这是好事。能用 0.87 美元搞定的一百万词,没人愿意掏 50 美元。能不能搞定那是另一回事,但至少选择权回到了我们手里。

在 2026 年的今天,你愿意为了跑分高 12 分多付 60 倍的钱吗?评论区聊聊。

相关文章
2026-07-24
你玩游戏卡顿不一定是显卡差:找瓶颈先看这 5 个参数 诊断指南
2026-07-20
3999 美元 Strix Halo 主机硬刚 DGX Spark,本地跑大模型选谁?
2026-08-12
开源AI奖学金2026:贡献开源AI项目拿报酬

本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论