你们用 Kimi K2 系列写过代码吗?K2.7-Code 开源了,会试试吗?

📡 AI新闻 💬 发布者: leakey
你们用 Kimi K2 系列写过代码吗?K2.7-Code 开源了,会试试吗?

🩺 摘要

Kimi K2.7-Code 开源:代码暴涨 21%,推理少想 30% 月之暗面又出手了。 距离 K2.6 开源还不到两个月,Kimi K2.7-Code 直接甩出来了。 这次不是"小版本迭代"——是一个专门为代码场景打磨的模型,而且是完全开源的。改进了 6 大 MCP 和 Code Benc

📝 详情

Kimi K2.7-Code 开源:代码暴涨 21%,推理少想 30%

月之暗面又出手了。

距离 K2.6 开源还不到两个月,Kimi K2.7-Code 直接甩出来了。

这次不是"小版本迭代"——是一个专门为代码场景打磨的模型,而且是完全开源的。改进了 6 大 MCP 和 Code Bench 评测方向,闭源模型的压力又大了一分。


01. 涨在哪?三个核心维度

官方给的提升数据很直接:

  • Kimi Code Bench v2:从 50.9 → 62.0,暴涨 21.8%
  • Program Bench:48.3 → 53.6,提升 11%
  • MLS Bench Lite:26.7 → 35.1,暴涨 31.5%

这三个基准分别测什么?

Kimi Code Bench 是月之暗面自家的综合代码评测,涵盖多语言、多场景。Program Bench 测的是编程问题解决能力。MLS Bench Lite 更偏机器学习工程——能在这个维度跳 31%,说明 K2.7-Code 对复杂 AI 工程任务的理解上了一层。

再看 Agent 能力:

  • MCP Mark Verified:72.8 → 81.1(+11.4%)
  • MCP Atlas:69.4 → 76.0(+9.5%)
  • Kimi Claw 24/7 Bench:42.9 → 46.9(+9.3%)

MCP 相关的两个基准是关键——它们测的是模型能不能在真实工具调用场景中完成任务。81.1 的 MCP Mark 分数意味着 K2.7-Code 在编排 MCP 工具链时比 K2.6 靠谱得多。

而且这些数字是跟上一代硬碰硬对比,不是"跟个弱基线比"。

02. 少想 30%:推理效率才是真香

这次最亮眼的一点,藏在细节里。

官方说推理 token 消耗比 K2.6 降低了约 30%

翻译成人话:K2.7-Code 学会了少想废话

K2.6 有个小毛病——它太"深思熟虑"了,有时遇到简单问题也要绕一圈才给答案。K2.7-Code 在推理效率上做了专门优化,同样的问题,想得更少、答得更准。

这对实际使用意味着什么?

如果你用 K2.7-Code 跑 coding agent(OpenClaw、Kimi Code CLI 等),每次调用的推理 token 少 30%,意味着延迟降低 + 成本下降。长程任务(几百步工具调用那种)的累积收益会非常明显。

架构上也不含糊:1T 总参数 / 32B 激活的 MoE、256K 上下文长度、MLA 注意力机制、MoonViT 视觉编码器。跟 K2.6 同架构家族,可以直接复用部署方案(vLLM / SGLang / KTransformers)。


03. 跟闭源比,差距还有多大?

官方在 model card 里大方地放了跟 GPT-5.5 和 Claude Opus 4.8 的对比。

基准 K2.7-Code GPT-5.5 Claude 4.8
Kimi Code Bench v2 62.0 69.0 67.4
Program Bench 53.6 69.1 63.8
MLS Bench Lite 35.1 35.5 42.8
MCP Mark Verified 81.1 92.9 76.4

结论很清楚:在代码场景上,K2.7-Code 已经在 MLS Bench Lite 追平 GPT-5.5,在 MCP Mark 上超越 Claude 4.8。但在 Program Bench 这类偏算法题的场景上,跟闭源头部还有 10-15 分的差距。

考虑到 K2.7-Code 是一个开源模型,这个成绩已经很能打了。闭源模型有更大的训练算力和数据,开源模型能在不到两个月的迭代里拉近这么多差距,这才是真正的看点。


我的判断。

月之暗面的迭代节奏越来越快。K2 → K2 Thinking → K2.5 → K2.6 → K2.7-Code,半年 5 个版本,每次都在特定维度上拉高。

K2.7-Code 这次的策略很聪明——不做全科生,做专才。聚焦代码场景,把推理效率砍 30%,把 MCP 能力拉到接近闭源水平。这种"垂直打磨"的思路比堆参数、提跑分更务实。

对开发者来说,现在有个开源选择,在 coding agent 场景下跟闭源模型的差距已经缩小到"值得一试"的程度了。


你们用 Kimi K2 系列写过代码吗?K2.7-Code 开源了,会试试吗?

Kimi K2.7-Code 开源:代码暴涨 21%,推理少想 30%

月之暗面又出手了。

距离 K2.6 开源还不到两个月,Kimi K2.7-Code 直接甩出来了。

这次不是"小版本迭代"——是一个专门为代码场景打磨的模型,而且是完全开源的。改进了 6 大 MCP 和 Code Bench 评测方向,闭源模型的压力又大了一分。


01. 涨在哪?三个核心维度

官方给的提升数据很直接:

  • Kimi Code Bench v2:从 50.9 → 62.0,暴涨 21.8%
  • Program Bench:48.3 → 53.6,提升 11%
  • MLS Bench Lite:26.7 → 35.1,暴涨 31.5%

这三个基准分别测什么?

Kimi Code Bench 是月之暗面自家的综合代码评测,涵盖多语言、多场景。Program Bench 测的是编程问题解决能力。MLS Bench Lite 更偏机器学习工程——能在这个维度跳 31%,说明 K2.7-Code 对复杂 AI 工程任务的理解上了一层。

再看 Agent 能力:

  • MCP Mark Verified:72.8 → 81.1(+11.4%)
  • MCP Atlas:69.4 → 76.0(+9.5%)
  • Kimi Claw 24/7 Bench:42.9 → 46.9(+9.3%)

MCP 相关的两个基准是关键——它们测的是模型能不能在真实工具调用场景中完成任务。81.1 的 MCP Mark 分数意味着 K2.7-Code 在编排 MCP 工具链时比 K2.6 靠谱得多。

而且这些数字是跟上一代硬碰硬对比,不是"跟个弱基线比"。

02. 少想 30%:推理效率才是真香

这次最亮眼的一点,藏在细节里。

官方说推理 token 消耗比 K2.6 降低了约 30%

翻译成人话:K2.7-Code 学会了少想废话

K2.6 有个小毛病——它太"深思熟虑"了,有时遇到简单问题也要绕一圈才给答案。K2.7-Code 在推理效率上做了专门优化,同样的问题,想得更少、答得更准。

这对实际使用意味着什么?

如果你用 K2.7-Code 跑 coding agent(OpenClaw、Kimi Code CLI 等),每次调用的推理 token 少 30%,意味着延迟降低 + 成本下降。长程任务(几百步工具调用那种)的累积收益会非常明显。

架构上也不含糊:1T 总参数 / 32B 激活的 MoE、256K 上下文长度、MLA 注意力机制、MoonViT 视觉编码器。跟 K2.6 同架构家族,可以直接复用部署方案(vLLM / SGLang / KTransformers)。


03. 跟闭源比,差距还有多大?

官方在 model card 里大方地放了跟 GPT-5.5 和 Claude Opus 4.8 的对比。

基准 K2.7-Code GPT-5.5 Claude 4.8
Kimi Code Bench v2 62.0 69.0 67.4
Program Bench 53.6 69.1 63.8
MLS Bench Lite 35.1 35.5 42.8
MCP Mark Verified 81.1 92.9 76.4

结论很清楚:在代码场景上,K2.7-Code 已经在 MLS Bench Lite 追平 GPT-5.5,在 MCP Mark 上超越 Claude 4.8。但在 Program Bench 这类偏算法题的场景上,跟闭源头部还有 10-15 分的差距。

考虑到 K2.7-Code 是一个开源模型,这个成绩已经很能打了。闭源模型有更大的训练算力和数据,开源模型能在不到两个月的迭代里拉近这么多差距,这才是真正的看点。


我的判断。

月之暗面的迭代节奏越来越快。K2 → K2 Thinking → K2.5 → K2.6 → K2.7-Code,半年 5 个版本,每次都在特定维度上拉高。

K2.7-Code 这次的策略很聪明——不做全科生,做专才。聚焦代码场景,把推理效率砍 30%,把 MCP 能力拉到接近闭源水平。这种"垂直打磨"的思路比堆参数、提跑分更务实。

对开发者来说,现在有个开源选择,在 coding agent 场景下跟闭源模型的差距已经缩小到"值得一试"的程度了。


你们用 Kimi K2 系列写过代码吗?K2.7-Code 开源了,会试试吗?