2.8 万亿参数开源!Kimi K3 把闭源旗舰逼到墙角
2.8 万亿参数开源!Kimi K3 把闭源旗舰逼到墙角 7 月 16 号,月之暗面把 Kimi K3 直接甩出来了。 2.8 万亿参数,全开源。 这是有史以来第一个开源模型冲破 3 万亿门槛的——前面卡着的,是 Llama 4 Behemoth 那个还没真正交付的 2 万亿"期货",再往前是
💡 你将学到
2.8 万亿参数开源!Kimi K3 把闭源旗舰逼到墙角 7 月 16 号,月之暗面把 Kimi K3 直接甩出来了。 2.8 万亿参数,全开源。 这是有史以来第一个开源模型冲破 3 万亿门槛的——前面卡着的,是 Llama 4 Behemoth 那个还没真正交付的 2 万亿"期货",再往前是
📜 目录
2.8 万亿参数开源!Kimi K3 把闭源旗舰逼到墙角
7 月 16 号,月之暗面把 Kimi K3 直接甩出来了。
2.8 万亿参数,全开源。
这是有史以来第一个开源模型冲破 3 万亿门槛的——前面卡着的,是 Llama 4 Behemoth 那个还没真正交付的 2 万亿"期货",再往前是 DeepSeek V4 那 1.6 万亿。K3 直接一脚踹开天花板。
但参数大本身不值钱。真正让我反复看了两遍的,是它同步放出来的几个"动手能力"演示。
01. 48 小时,AI 自己给自己设计了一块芯片
Kimi K3 拿到一个任务:用开源 EDA 工具 + Nangate 45nm 工艺库,48 小时内独立设计一颗 AI 推理芯片。
它做出来了。
- 4 mm² 面积
- 时序闭合在 100 MHz
- 仿真持续吞吐 8,700 tokens/s 解码
- 塞进 1.46M 个标准单元、0.277 MB SRAM
- 一颗 INT4 MAC 阵列,带融合反量化
换句话说,一个大模型在两天之内,把"AI 加速器是怎么造出来的"这件事从头到尾跑了一遍——前端、综合、布局布线、验证。它给另一颗 AI 设计硬件,AI 跑在 AI 设计的芯片上。 这不是 demo,这是月之暗面技术报告里白纸黑字的数字。
02. 它顺手写了个 GPU 编译器
嫌演示不够硬?K3 还顺手写了个 Triton 级别的编译器,叫 MiniTriton。
- 自带 MLIR 之上的 tile 级 IR
- 有自己的优化 pass
- 有 PTX 代码生成流水线
跑 roofline benchmark,跟 Triton 和 torch.compile 持平,部分负载直接反超 Triton。最离谱的是,它用这套自己写的工具链跑 nanoGPT 端到端训练,loss 曲线紧紧贴着参考实现。
这意味着什么?大模型不再只是"调用编译器",它开始"造编译器"。 以前是程序员写 CUDA,以后程序员可能只是给 K3 提需求。
03. 2.8 万亿怎么跑起来?两个新架构加 MXFP4 量化
参数堆到 2.8T,单卡肯定跑不下。K3 的解法是两个全新的架构组件,再加一套从训练阶段就设计好的量化方案。
- Kimi Delta Attention (KDA):对 attention 的线性化改造,长上下文下 KV 缓存可以预填,token 单价直接被打下来
- Attention Residuals (AttnRes):一种新的残差连接方式,让信息在超深网络里流动得更稳
底座是 Stable LatentMoE,激活 16/896 专家——也就是说你每次推理只调用约 1.8% 的参数,但能享受 2.8T 的知识容量。
更关键的是量化策略:MXFP4 权重 + MXFP8 激活,从 SFT 阶段就开始做量化感知训练。这意味着权重和激活在训练时就已经按 4-bit 数值格式优化,而不是训完之后再压缩——后者会掉精度,前者能保住推理质量。
但别把量化理解成"普通显卡就能跑"。月之暗面官方对部署硬件的明确建议是:
"We recommend deploying Kimi K3 on supernode configurations with 64 or more accelerators."
64 卡及以上的 supernode 配置——这是给超算中心准备的弹药,不是给普通玩家准备的玩具。K2.5 时代的 INT4 量化部署用的也是 vLLM / SGLang / KTransformers 这些分布式推理框架。开源社区目前还没有公开的"单机部署 K3"案例,原因很简单:2.8T 模型哪怕按 4-bit 量化也要约 1.4TB 显存,单卡 H200(141GB HBM3e)根本装不下。
对开发者来说,现实路径只有两条:要么走 Moonshot 官方的 Kimi API,要么攒够 64 张加速卡做 supernode 部署。别被"全开源"三个字冲昏头脑——开源的是权重,不是部署成本。
04. 月之暗面这次,跟所有开源玩家抢饭碗
你可能觉得"开源旗舰"这个故事 DeepSeek 已经讲过了。不一样。
DeepSeek V4 是 1.6T,性能强但仍是"开源追闭源"的姿态。K3 的官方说法是:
"整体性能仍落后于 Claude Fable 5 和 GPT 5.6 Sol,但在我们整套评测里达到了 frontier 级别,稳定超越其他被测模型,包括 Opus 4.8、GPT 5.6 Sol、GPT 5.5。"
翻译成人话:K3 不是追着闭源跑,它在某些维度已经把 GPT 5.5、Opus 4.8 这种上一代闭源旗舰踩在脚下了。 离天花板还差半步,但已经坐在桌子边上了。
再看一眼这个时间点:
- GPT-5.6 Sol 上线没几天,就被曝自动删用户文件、删生产数据库
- Claude Fable 5 强在异步多步任务,但 API 贵得离谱
- OpenAI 把 GPT-Red 拉出来做自动红队,本质是承认自家模型还在被攻破
K3 这时候甩出一个性能在自家评测里 frontier、训练方法完全公开、权重全部放出的 2.8T 模型——这不是在追赶,这是在掀桌子。
05. 开发者、老板、看 AGI 的人,这次都有份
- 如果你跑业务:Kimi API 平台已经上线 kimi-k3 选项,Mooncake 推理架构下 cache hit > 90%,编码场景的 token 价格非常能打。Claude Code 用户可以零成本换 Kimi Code(同一套 CLI 体验)。
- 如果你是开发者:权重在 Hugging Face,MXFP4 量化 + vLLM / SGLang / KTransformers 推理框架支持,但月之暗面官方建议是 64 卡及以上 supernode 部署——自己跑要做好至少百万级的硬件预算
- 如果你关心 AGI 时间表:当一个模型能自己写编译器、自己设计芯片、自己做 3D 游戏——我们离"模型自己造下一代模型"还差几个版本?
06. 参数是门票,但 6 个月后还在才算数
月之暗面这家公司的打法,过去两年一直被低估。
Kimi K1.5 的时候大家说"Moonshot 只擅长长上下文",K2 出来大家说"还是打不过 GPT-4 后裔"。K3 这一拳,是真的打到闭源阵营的脸上了。
但我得泼盆冷水:开源模型的真正考验不是发布当天有多炸,而是 6 个月后社区还认不认。 Llama 3 当年也是"开源王炸",结果 MetaAI 团队走了之后生态直接断档。Kimi 这一波能不能持续开源迭代、能不能撑起 Discord/Hugging Face 上的开发者社区,比参数更重要。
参数是门票,生态才是护城河。
评论区聊聊:你觉得 K3 最让你惊艳的是哪个能力——自设计芯片、写编译器、还是 MoE + 4-bit 量化的工程组合拳?如果你是开发者,你会第一时间把 K3 接到自己的项目里跑一跑吗?来,评论区等你。
本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。
