你们用 Kimi K2 系列写过代码吗?K2.7-Code 开源了,会试试吗?
🩺 摘要
Kimi K2.7-Code 开源:代码暴涨 21%,推理少想 30% 月之暗面又出手了。 距离 K2.6 开源还不到两个月,Kimi K2.7-Code 直接甩出来了。 这次不是"小版本迭代"——是一个专门为代码场景打磨的模型,而且是完全开源的。改进了 6 大 MCP 和 Code Benc
📝 详情
Kimi K2.7-Code 开源:代码暴涨 21%,推理少想 30%
月之暗面又出手了。
距离 K2.6 开源还不到两个月,Kimi K2.7-Code 直接甩出来了。
这次不是"小版本迭代"——是一个专门为代码场景打磨的模型,而且是完全开源的。改进了 6 大 MCP 和 Code Bench 评测方向,闭源模型的压力又大了一分。
01. 涨在哪?三个核心维度
官方给的提升数据很直接:
- Kimi Code Bench v2:从 50.9 → 62.0,暴涨 21.8%
- Program Bench:48.3 → 53.6,提升 11%
- MLS Bench Lite:26.7 → 35.1,暴涨 31.5%
这三个基准分别测什么?
Kimi Code Bench 是月之暗面自家的综合代码评测,涵盖多语言、多场景。Program Bench 测的是编程问题解决能力。MLS Bench Lite 更偏机器学习工程——能在这个维度跳 31%,说明 K2.7-Code 对复杂 AI 工程任务的理解上了一层。
再看 Agent 能力:
- MCP Mark Verified:72.8 → 81.1(+11.4%)
- MCP Atlas:69.4 → 76.0(+9.5%)
- Kimi Claw 24/7 Bench:42.9 → 46.9(+9.3%)
MCP 相关的两个基准是关键——它们测的是模型能不能在真实工具调用场景中完成任务。81.1 的 MCP Mark 分数意味着 K2.7-Code 在编排 MCP 工具链时比 K2.6 靠谱得多。
而且这些数字是跟上一代硬碰硬对比,不是"跟个弱基线比"。
02. 少想 30%:推理效率才是真香
这次最亮眼的一点,藏在细节里。
官方说推理 token 消耗比 K2.6 降低了约 30%。
翻译成人话:K2.7-Code 学会了少想废话。
K2.6 有个小毛病——它太"深思熟虑"了,有时遇到简单问题也要绕一圈才给答案。K2.7-Code 在推理效率上做了专门优化,同样的问题,想得更少、答得更准。
这对实际使用意味着什么?
如果你用 K2.7-Code 跑 coding agent(OpenClaw、Kimi Code CLI 等),每次调用的推理 token 少 30%,意味着延迟降低 + 成本下降。长程任务(几百步工具调用那种)的累积收益会非常明显。
架构上也不含糊:1T 总参数 / 32B 激活的 MoE、256K 上下文长度、MLA 注意力机制、MoonViT 视觉编码器。跟 K2.6 同架构家族,可以直接复用部署方案(vLLM / SGLang / KTransformers)。
03. 跟闭源比,差距还有多大?
官方在 model card 里大方地放了跟 GPT-5.5 和 Claude Opus 4.8 的对比。
| 基准 | K2.7-Code | GPT-5.5 | Claude 4.8 |
|---|---|---|---|
| Kimi Code Bench v2 | 62.0 | 69.0 | 67.4 |
| Program Bench | 53.6 | 69.1 | 63.8 |
| MLS Bench Lite | 35.1 | 35.5 | 42.8 |
| MCP Mark Verified | 81.1 | 92.9 | 76.4 |
结论很清楚:在代码场景上,K2.7-Code 已经在 MLS Bench Lite 追平 GPT-5.5,在 MCP Mark 上超越 Claude 4.8。但在 Program Bench 这类偏算法题的场景上,跟闭源头部还有 10-15 分的差距。
考虑到 K2.7-Code 是一个开源模型,这个成绩已经很能打了。闭源模型有更大的训练算力和数据,开源模型能在不到两个月的迭代里拉近这么多差距,这才是真正的看点。
我的判断。
月之暗面的迭代节奏越来越快。K2 → K2 Thinking → K2.5 → K2.6 → K2.7-Code,半年 5 个版本,每次都在特定维度上拉高。
K2.7-Code 这次的策略很聪明——不做全科生,做专才。聚焦代码场景,把推理效率砍 30%,把 MCP 能力拉到接近闭源水平。这种"垂直打磨"的思路比堆参数、提跑分更务实。
对开发者来说,现在有个开源选择,在 coding agent 场景下跟闭源模型的差距已经缩小到"值得一试"的程度了。
你们用 Kimi K2 系列写过代码吗?K2.7-Code 开源了,会试试吗?
Kimi K2.7-Code 开源:代码暴涨 21%,推理少想 30%
月之暗面又出手了。
距离 K2.6 开源还不到两个月,Kimi K2.7-Code 直接甩出来了。
这次不是"小版本迭代"——是一个专门为代码场景打磨的模型,而且是完全开源的。改进了 6 大 MCP 和 Code Bench 评测方向,闭源模型的压力又大了一分。
01. 涨在哪?三个核心维度
官方给的提升数据很直接:
- Kimi Code Bench v2:从 50.9 → 62.0,暴涨 21.8%
- Program Bench:48.3 → 53.6,提升 11%
- MLS Bench Lite:26.7 → 35.1,暴涨 31.5%
这三个基准分别测什么?
Kimi Code Bench 是月之暗面自家的综合代码评测,涵盖多语言、多场景。Program Bench 测的是编程问题解决能力。MLS Bench Lite 更偏机器学习工程——能在这个维度跳 31%,说明 K2.7-Code 对复杂 AI 工程任务的理解上了一层。
再看 Agent 能力:
- MCP Mark Verified:72.8 → 81.1(+11.4%)
- MCP Atlas:69.4 → 76.0(+9.5%)
- Kimi Claw 24/7 Bench:42.9 → 46.9(+9.3%)
MCP 相关的两个基准是关键——它们测的是模型能不能在真实工具调用场景中完成任务。81.1 的 MCP Mark 分数意味着 K2.7-Code 在编排 MCP 工具链时比 K2.6 靠谱得多。
而且这些数字是跟上一代硬碰硬对比,不是"跟个弱基线比"。
02. 少想 30%:推理效率才是真香
这次最亮眼的一点,藏在细节里。
官方说推理 token 消耗比 K2.6 降低了约 30%。
翻译成人话:K2.7-Code 学会了少想废话。
K2.6 有个小毛病——它太"深思熟虑"了,有时遇到简单问题也要绕一圈才给答案。K2.7-Code 在推理效率上做了专门优化,同样的问题,想得更少、答得更准。
这对实际使用意味着什么?
如果你用 K2.7-Code 跑 coding agent(OpenClaw、Kimi Code CLI 等),每次调用的推理 token 少 30%,意味着延迟降低 + 成本下降。长程任务(几百步工具调用那种)的累积收益会非常明显。
架构上也不含糊:1T 总参数 / 32B 激活的 MoE、256K 上下文长度、MLA 注意力机制、MoonViT 视觉编码器。跟 K2.6 同架构家族,可以直接复用部署方案(vLLM / SGLang / KTransformers)。
03. 跟闭源比,差距还有多大?
官方在 model card 里大方地放了跟 GPT-5.5 和 Claude Opus 4.8 的对比。
| 基准 | K2.7-Code | GPT-5.5 | Claude 4.8 |
|---|---|---|---|
| Kimi Code Bench v2 | 62.0 | 69.0 | 67.4 |
| Program Bench | 53.6 | 69.1 | 63.8 |
| MLS Bench Lite | 35.1 | 35.5 | 42.8 |
| MCP Mark Verified | 81.1 | 92.9 | 76.4 |
结论很清楚:在代码场景上,K2.7-Code 已经在 MLS Bench Lite 追平 GPT-5.5,在 MCP Mark 上超越 Claude 4.8。但在 Program Bench 这类偏算法题的场景上,跟闭源头部还有 10-15 分的差距。
考虑到 K2.7-Code 是一个开源模型,这个成绩已经很能打了。闭源模型有更大的训练算力和数据,开源模型能在不到两个月的迭代里拉近这么多差距,这才是真正的看点。
我的判断。
月之暗面的迭代节奏越来越快。K2 → K2 Thinking → K2.5 → K2.6 → K2.7-Code,半年 5 个版本,每次都在特定维度上拉高。
K2.7-Code 这次的策略很聪明——不做全科生,做专才。聚焦代码场景,把推理效率砍 30%,把 MCP 能力拉到接近闭源水平。这种"垂直打磨"的思路比堆参数、提跑分更务实。
对开发者来说,现在有个开源选择,在 coding agent 场景下跟闭源模型的差距已经缩小到"值得一试"的程度了。
你们用 Kimi K2 系列写过代码吗?K2.7-Code 开源了,会试试吗?
💬 评论 (0)