昨天Kimi发了K2.7,今天MiniMax甩出M3,开源代码模型卷疯了

📡 AI新闻 💬 发布者: leakey
昨天Kimi发了K2.7,今天MiniMax甩出M3,开源代码模型卷疯了

🩺 摘要

昨天Kimi发了K2.7,今天MiniMax甩出M3,开源代码模型卷疯了 昨天月之暗面开源了 Kimi K2.7-Code,这个我们聊过了。 今天轮到 MiniMax。 同样是开源权重,同样是代码模型,但 M3 的打法不太一样——它不讲单项最强,它讲"我全要"。 编码 + 1M 上下文 +

📝 详情

昨天Kimi发了K2.7,今天MiniMax甩出M3,开源代码模型卷疯了

昨天月之暗面开源了 Kimi K2.7-Code,这个我们聊过了。

今天轮到 MiniMax。

同样是开源权重,同样是代码模型,但 M3 的打法不太一样——它不讲单项最强,它讲"我全要"。

编码 + 1M 上下文 + 原生多模态,三个能力打包进一个开源模型。

这在开源阵营里,确实头一回见。

01. M3 的第一个杀招:编码能力硬刚闭源旗舰

M3 总参数 428B,激活参数 23B。MoE 架构。

看几个关键数据:

SWE-Bench Pro 拿到 59.0%——超过 GPT-5.5 和 Gemini 3.1 Pro,逼近 Claude Opus 4.7。

Terminal Bench 2.1 是 66.0%

MCP Atlas(衡量模型对工具协议的理解和执行能力)是 74.2%。

KernelBench Hard 是 28.8%。

SWE-fficiency 是 34.8%。

一个一个看。SWE-Bench Pro 是目前公认难度最高的真实软件工程测评集,它不是刷 LeetCode,是直接修真实 GitHub 项目的 issue。在这个赛道上,M3 已经跨过了 GPT-5.5 这条线。

Terminal Bench 测的是终端环境下的多步骤任务执行能力,66.0% 这个数字放在开源模型里是第一梯队的。

MCP Atlas 这个评测很多人不熟——它是测模型能不能理解 MCP 协议、能不能正确调用工具。66%→74.2%,说明 M3 在 Agent 场景下的工具调用能力不是喊口号,是真的有提升。

02. 第二个杀招:1M 超长上下文,但真正值钱的是背后的架构

1M token 上下文,MiniMax M2.7 就有了,不新鲜。

新鲜的是 M3 怎么做到的。

M3 用了自研的 MiniMax 稀疏注意力架构,名字叫 MSA(MiniMax Sparse Attention)。

传统全注意力机制在长上下文场景下计算量是 O(n²),token 越多越跑不动,成本越高。MSA 的核心思路是:不是所有 token 都需要跟所有 token"互看",大部分注意力计算是浪费的。

结果是:

在 100 万 token 上下文规模下,M3 单 token 计算量只有上代模型的约 1/20。

这是真正的工程护城河。

翻译成开发者能感知的话:别人处理一个 50 万 token 的代码仓库,可能已经触发 OOM 或者烧掉大量算力成本;M3 还能稳稳地跑完整个流程,成本还低一个数量级。

对于做大型代码库重构、长文档 RAG、长周期 Agent 任务的人来说,这点是实打实的生产力差异。

03. 第三个杀招:原生多模态,不是后加补丁

很多模型的"多模态"是做完了文本模型,再外挂一个视觉模块。

M3 不是。它从训练第一天就是文本、图片、视频混合训练,数据规模和训练管线都做了扩展。

支持图像理解、视频理解,还支持 Computer Use——让 AI 像人一样操作电脑桌面,在多个应用之间切换完成任务。

加上前两个能力,M3 的应用场景覆盖了三块:

  • 编码 + Agent 场景(SWE-Bench Pro、MCP Atlas 的高分支撑)
  • 长文档 + 大型代码库(1M 上下文 + MSA 架构的算力优势)
  • 多模态 + 桌面操控(原生多模态 + Computer Use)

这三个场景单独拿出来,开源模型里都能找到对应产品。但打包在一个开源权重里,M3 是第一家。

04. 说点大实话

M3 的 API 定价是输入 4.2 元/百万 token,Plus 订阅 49 元/月给 6 亿 token——大约等于 Claude Pro 的五倍容量。价格策略很明显:用开源打开发者心智,用低价抢 B 端份额。

但有一说一,有几个点需要冷静看。

第一,M3 今天上的是 HuggingFace 开源权重,但技术报告和完整权重大约 10 天后才发布。现在能看到的数据都是 MiniMax 官方跑的,需要等第三方独立复测验证。

第二,SWE-Bench Pro 59.0% 超过了 GPT-5.5,但 GPT-5.5 本身在 Coding 评测上并不是最强的——Claude Opus 4.7 和 Fable 5 分数更高。同时,跑分和实际生产环境有差距,真正好不好用,得上手跑几轮才知道。

第三,M3 的定位是"全能",但全能也意味着在特定方向上可能不如专精模型。编码深度上,可能不如专做代码的 K2.7-Code;长上下文上,虽然 MSA 架构效率高,但 1M 窗口的端到端稳定性和召回率还需要实测。

整体来看,M3 是一个竞争力很强的开源模型。三项能力完整打包,在编码、Agent、长上下文和视觉场景下都有实用价值。加上 MiniMax 自己做 C 端产品的全模态经验(海螺 AI、星野、Talkie),多模态这块的积累不是一天两天的事。

MiniMax 最近也在推进 A 股 IPO。开源自研旗舰模型 + 冲击科创板,这套组合拳的节奏感很强。

动手试试? 模型已经在 HuggingFace 上架:https://huggingface.co/MiniMaxAI/MiniMax-M3

你们觉得,M3 这个"三合一"定位,是开源模型该走的方向吗?还是应该像 K2.7 那样只精耕代码?评论区聊聊。

昨天Kimi发了K2.7,今天MiniMax甩出M3,开源代码模型卷疯了

昨天月之暗面开源了 Kimi K2.7-Code,这个我们聊过了。

今天轮到 MiniMax。

同样是开源权重,同样是代码模型,但 M3 的打法不太一样——它不讲单项最强,它讲"我全要"。

编码 + 1M 上下文 + 原生多模态,三个能力打包进一个开源模型。

这在开源阵营里,确实头一回见。

01. M3 的第一个杀招:编码能力硬刚闭源旗舰

M3 总参数 428B,激活参数 23B。MoE 架构。

看几个关键数据:

SWE-Bench Pro 拿到 59.0%——超过 GPT-5.5 和 Gemini 3.1 Pro,逼近 Claude Opus 4.7。

Terminal Bench 2.1 是 66.0%

MCP Atlas(衡量模型对工具协议的理解和执行能力)是 74.2%。

KernelBench Hard 是 28.8%。

SWE-fficiency 是 34.8%。

一个一个看。SWE-Bench Pro 是目前公认难度最高的真实软件工程测评集,它不是刷 LeetCode,是直接修真实 GitHub 项目的 issue。在这个赛道上,M3 已经跨过了 GPT-5.5 这条线。

Terminal Bench 测的是终端环境下的多步骤任务执行能力,66.0% 这个数字放在开源模型里是第一梯队的。

MCP Atlas 这个评测很多人不熟——它是测模型能不能理解 MCP 协议、能不能正确调用工具。66%→74.2%,说明 M3 在 Agent 场景下的工具调用能力不是喊口号,是真的有提升。

02. 第二个杀招:1M 超长上下文,但真正值钱的是背后的架构

1M token 上下文,MiniMax M2.7 就有了,不新鲜。

新鲜的是 M3 怎么做到的。

M3 用了自研的 MiniMax 稀疏注意力架构,名字叫 MSA(MiniMax Sparse Attention)。

传统全注意力机制在长上下文场景下计算量是 O(n²),token 越多越跑不动,成本越高。MSA 的核心思路是:不是所有 token 都需要跟所有 token"互看",大部分注意力计算是浪费的。

结果是:

在 100 万 token 上下文规模下,M3 单 token 计算量只有上代模型的约 1/20。

这是真正的工程护城河。

翻译成开发者能感知的话:别人处理一个 50 万 token 的代码仓库,可能已经触发 OOM 或者烧掉大量算力成本;M3 还能稳稳地跑完整个流程,成本还低一个数量级。

对于做大型代码库重构、长文档 RAG、长周期 Agent 任务的人来说,这点是实打实的生产力差异。

03. 第三个杀招:原生多模态,不是后加补丁

很多模型的"多模态"是做完了文本模型,再外挂一个视觉模块。

M3 不是。它从训练第一天就是文本、图片、视频混合训练,数据规模和训练管线都做了扩展。

支持图像理解、视频理解,还支持 Computer Use——让 AI 像人一样操作电脑桌面,在多个应用之间切换完成任务。

加上前两个能力,M3 的应用场景覆盖了三块:

  • 编码 + Agent 场景(SWE-Bench Pro、MCP Atlas 的高分支撑)
  • 长文档 + 大型代码库(1M 上下文 + MSA 架构的算力优势)
  • 多模态 + 桌面操控(原生多模态 + Computer Use)

这三个场景单独拿出来,开源模型里都能找到对应产品。但打包在一个开源权重里,M3 是第一家。

04. 说点大实话

M3 的 API 定价是输入 4.2 元/百万 token,Plus 订阅 49 元/月给 6 亿 token——大约等于 Claude Pro 的五倍容量。价格策略很明显:用开源打开发者心智,用低价抢 B 端份额。

但有一说一,有几个点需要冷静看。

第一,M3 今天上的是 HuggingFace 开源权重,但技术报告和完整权重大约 10 天后才发布。现在能看到的数据都是 MiniMax 官方跑的,需要等第三方独立复测验证。

第二,SWE-Bench Pro 59.0% 超过了 GPT-5.5,但 GPT-5.5 本身在 Coding 评测上并不是最强的——Claude Opus 4.7 和 Fable 5 分数更高。同时,跑分和实际生产环境有差距,真正好不好用,得上手跑几轮才知道。

第三,M3 的定位是"全能",但全能也意味着在特定方向上可能不如专精模型。编码深度上,可能不如专做代码的 K2.7-Code;长上下文上,虽然 MSA 架构效率高,但 1M 窗口的端到端稳定性和召回率还需要实测。

整体来看,M3 是一个竞争力很强的开源模型。三项能力完整打包,在编码、Agent、长上下文和视觉场景下都有实用价值。加上 MiniMax 自己做 C 端产品的全模态经验(海螺 AI、星野、Talkie),多模态这块的积累不是一天两天的事。

MiniMax 最近也在推进 A 股 IPO。开源自研旗舰模型 + 冲击科创板,这套组合拳的节奏感很强。

动手试试? 模型已经在 HuggingFace 上架:https://huggingface.co/MiniMaxAI/MiniMax-M3

你们觉得,M3 这个"三合一"定位,是开源模型该走的方向吗?还是应该像 K2.7 那样只精耕代码?评论区聊聊。