Sakana Fugu:把多智能体编排做成单模型,日本换了一条赛道

📡 AI新闻 2026-07-26 约 19 分钟阅读

Sakana Fugu:把多智能体编排做成单模型,日本换了一条赛道 就在 6 月 22 号,东京的 Sakana AI 扔出了一颗炸弹——Sakana Fugu。 这是一家你大概率没听过名字的公司。Transformer 架构之外的另一条路,日本国家队式押注的自然启发路线(nature-insp

Sakana Fugu:把多智能体编排做成单模型,日本换了一条赛道

就在 6 月 22 号,东京的 Sakana AI 扔出了一颗炸弹——Sakana Fugu

这是一家你大概率没听过名字的公司。Transformer 架构之外的另一条路,日本国家队式押注的自然启发路线(nature-inspired),靠"演化模型合并"起家。

但这次他们不讲老故事了。Fugu Ultra 在 SWE-bench、Terminal-bench、AIME 2025、GPQA、ARC-AGI 一整套基准上,对标 Anthropic 的 Fable 5 和 Mythos Preview。

注意——是"对标",不是"接近"。注意——这两款被拿来当靶子的模型,自己都不在 Fugu 的代理池里

下面我把这条新闻掰开讲清楚。

不是又一个大模型,是"调度其他大模型的模型"

先讲清楚 Fugu 到底是什么,免得你把它当 Qwen3.7 或者 GLM-5.2 这种普通新模型看。

Fugu 本质是个多智能体编排系统。但它的骚操作是——把整套多智能体封装成了一个语言模型。你只调一个 OpenAI 兼容的 API,背后谁被调用、怎么协同、怎么验证,Fugu 自己搞定。

具体来说,Fugu 本身是一个 LLM,专门训练出来"学怎么当调度员"——什么时候该把任务派给哪个专家模型,多个模型的结果怎么合成一个可信答案。理论上它甚至可以递归调用自己

底层技术来自他们两篇 ICLR 2026 论文:Trinity(Evolved LLM Coordinator,arXiv 2512.04695)和 Conductor(Natural Language Orchestration,arXiv 2512.04388)。简单讲就是让"调度"这件事从人写规则变成模型自己学。

发布时分成两档:Fugu(低延迟、默认日常用,主打 Codex 这类工具场景)、Fugu Ultra(重推理、深度任务,AutoResearch、论文复现、网安分析、专利调研全靠它)。

性能:自报对标 Fable 5,但故事更精彩的是"用什么打的"

Sakana 这次公布的 Fugu Ultra 跑分值得仔细看。

注:以下数字来自 Sakana 官方技术报告。Fable 5 和 Mythos Preview 的分数取 Sakana 公开报告版本(两者均不在 Fugu 的代理池里,所以这场对比本质是"白盒调度 vs 黑盒巨兽")。

换句话说——这些基准上没有一项被 Claude Opus 4.8 这种自研巨型模型吊打,反而在多个项目上跑赢。

但比分数更值得注意的是打法:Fugu 池子里跑的可能是 Gemini 3.1 Pro、Opus 4.8、GPT-5.5 这一档模型(每个子任务用不同模型),但调度权在 Fugu 自己手里。这不是"用一个超大模型硬扛",而是"一群专家协同 + 一个聪明的指挥家"。

这就引出了下一节最反常识的卖点。

地缘政治卖点:Fable 5 被美国卡脖子,Fugu 就成了"AI 主权"答案

这条新闻如果只看技术,会错过它一半的价值。

Sakana 在博文中明确点名:"Anthropic Fable 5 和 Mythos Preview 已被美国出口管制"。这句话翻译过来——

"世界上的某些最强模型,可能你明天就用不到了。"

Fugu 的应对方案是模型池完全可替换。哪天 Gemini 不给日本用了、哪天 Opus 不给东亚地区用了,Fugu 会自动绕开这个供应商,调用其他能用的。

Sakana 直接把这种能力包装成"AI sovereignty(AI 主权)"——这个说法在英文 AI 圈已经是高频词了,但在中文媒体上几乎没人提。Sakana 是第一家把这件事做成产品级 API 的公司。

日本为什么会押 Sakana?这就说得通了。日本的国情决定了它不能押单一美国供应商,而 Sakana 2023 年成立那会儿,背后站着 NTT、KDD、索尼、丰田这些本土巨头,融资列表里有 Citi、Salesforce Ventures,跟 Google、Datadog 还有战略合作。

这不是一家"野生 AI 公司"。这是日本的国家级备胎

实际跑起来什么样?500 名 beta 用户的故事

跑分只是开胃菜。Sakana 这次披露的 beta 数据有意思得多:

Sakana 还挑了几个特别有"日本味"的测试场景:机械设计、Rubik's Cube 求解、日文手写识别、单步国际象棋、金融时序预测。每一项 Fugu 都比 Gemini 3.1 Pro、Opus 4.8、GPT-5.5 强。

这不是"通用基准刷榜"。这是 Sakana 在说:"我们这种编排思路在长链条、多步骤、需要审慎决策的真实任务上,恰恰是巨型单体模型最不擅长的地方。"

你能用吗?怎么用?选型建议

Sakana Fugu 今天已经 GA(一般可用),不需要等。

具体接入路径: - 一个 OpenAI 兼容的 API,Fugu 和 Fugu Ultra 两档 - 订阅制(日常用)+ Pay-as-you-go(企业重负载) - 隐私敏感客户可以主动把某些模型从 Fugu 的池子里剔除 - 已经有商用产品 Sakana Marlin(深度研究助手)在 β 测试,跟 SMBC、三菱 UFJ 银行都有合作

我的选型建议(不是和稀泥那种):

场景 A:你日常写代码、做笔记、跑数据清洗这种中等复杂度任务 → 用 Fugu,成本和延迟都友好
场景 B:你要做论文复现、网安审计、专利调研这类长链条多步骤任务 → Fugu Ultra 是当下少见的"专门为这类场景设计"的产品
场景 C:你在国内做面向日本客户的产品 → 重点关注,AI 主权是个真问题不是营销词

个人观点:Sakana Fugu 真正改变的不是"性能",是"路线"

看完整件事后,我有一个不太主流的判断。

Sakana Fugu 的真正意义,不在它追平了 Fable 5,而在它把"调度"这件事从工程问题变成了模型问题。

过去两年,整个行业——OpenAI、Anthropic、Google DeepMind、Meta——全在比"我的基座模型能跑多少分"。这条路线的尽头是什么?是烧更多的算力、堆更多的数据、雇更多的博士。

Sakana 走的是另一条路:基座模型的边际收益在递减,那么把"怎么用模型"这件事本身也变成一个可学习的对象,会不会有惊喜?

这次的答案显然是"有"。而且更狠的是,这条路线天然绕开了"出口管制"——你不给我用 Fable 5?没关系,Fugu 可以调度别的。

这件事对中国的启示其实比表面看起来更直接。当所有人都在追"基座对标 GPT-5.5",可能忽略了一条更现实的赛道——把不同基座按场景动态编排。 这条路日本人先跑出来了。

但我也要泼一盆冷水:Sakana 自己公布的 benchmark 不等于第三方独立验证。 AIME 2025、ARC-AGI 这些基准容易出"精心挑题"的偏差。等 HuggingFace、Arena、独立评测机构出一轮独立数据再看。

还有一层隐忧:Fugu Ultra 的 token 成本一定是贵的。背后要调多个专家模型,每多一跳都加钱。中小企业真用起来要算清楚账单。

最后一句话:Sakana 这次不是"日本出了个大模型",而是"日本给整个 AI 行业提了个新问题——大模型的尽头一定是更大的单体吗?"

这个问题,中国厂商可能比美国人更需要回答。


评论区我想听听你的判断:你觉得"编排即模型"会是中国 AI 公司弯道超车的下一个切口,还是日本人又一次技术理想主义的孤勇? 顺便问一句——如果你的工作流要从单一模型迁到这种编排系统,最大的顾虑是成本、数据隐私、还是可解释性

相关文章
2026-07-26
OpenAI模型安全测试失控,自主黑入Hugging Face
2026-07-26
三星考虑向Mistral AI投资10亿欧元,估值200亿欧元
2026-07-26
OpenAI上调2030年算力支出至7500亿美元,拟建200亿美元数据中心

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论