2.8 万亿参数开源!Kimi K3 把闭源旗舰逼到墙角

📡 AI新闻 2026-08-17 约 1 分钟阅读

2.8 万亿参数开源!Kimi K3 把闭源旗舰逼到墙角 7 月 16 号,月之暗面把 Kimi K3 直接甩出来了。 2.8 万亿参数,全开源。 这是有史以来第一个开源模型冲破 3 万亿门槛的——前面卡着的,是 Llama 4 Behemoth 那个还没真正交付的 2 万亿"期货",再往前是

💡 你将学到

2.8 万亿参数开源!Kimi K3 把闭源旗舰逼到墙角 7 月 16 号,月之暗面把 Kimi K3 直接甩出来了。 2.8 万亿参数,全开源。 这是有史以来第一个开源模型冲破 3 万亿门槛的——前面卡着的,是 Llama 4 Behemoth 那个还没真正交付的 2 万亿"期货",再往前是

📜 目录

2.8 万亿参数开源!Kimi K3 把闭源旗舰逼到墙角

7 月 16 号,月之暗面把 Kimi K3 直接甩出来了。

2.8 万亿参数,全开源。

这是有史以来第一个开源模型冲破 3 万亿门槛的——前面卡着的,是 Llama 4 Behemoth 那个还没真正交付的 2 万亿"期货",再往前是 DeepSeek V4 那 1.6 万亿。K3 直接一脚踹开天花板。

但参数大本身不值钱。真正让我反复看了两遍的,是它同步放出来的几个"动手能力"演示。

01. 48 小时,AI 自己给自己设计了一块芯片

Kimi K3 拿到一个任务:用开源 EDA 工具 + Nangate 45nm 工艺库,48 小时内独立设计一颗 AI 推理芯片。

它做出来了。

换句话说,一个大模型在两天之内,把"AI 加速器是怎么造出来的"这件事从头到尾跑了一遍——前端、综合、布局布线、验证。它给另一颗 AI 设计硬件,AI 跑在 AI 设计的芯片上。 这不是 demo,这是月之暗面技术报告里白纸黑字的数字。

02. 它顺手写了个 GPU 编译器

嫌演示不够硬?K3 还顺手写了个 Triton 级别的编译器,叫 MiniTriton

跑 roofline benchmark,跟 Triton 和 torch.compile 持平,部分负载直接反超 Triton。最离谱的是,它用这套自己写的工具链跑 nanoGPT 端到端训练,loss 曲线紧紧贴着参考实现。

这意味着什么?大模型不再只是"调用编译器",它开始"造编译器"。 以前是程序员写 CUDA,以后程序员可能只是给 K3 提需求。

03. 2.8 万亿怎么跑起来?两个新架构加 MXFP4 量化

参数堆到 2.8T,单卡肯定跑不下。K3 的解法是两个全新的架构组件,再加一套从训练阶段就设计好的量化方案。

底座是 Stable LatentMoE,激活 16/896 专家——也就是说你每次推理只调用约 1.8% 的参数,但能享受 2.8T 的知识容量。

更关键的是量化策略:MXFP4 权重 + MXFP8 激活,从 SFT 阶段就开始做量化感知训练。这意味着权重和激活在训练时就已经按 4-bit 数值格式优化,而不是训完之后再压缩——后者会掉精度,前者能保住推理质量。

但别把量化理解成"普通显卡就能跑"。月之暗面官方对部署硬件的明确建议是:

"We recommend deploying Kimi K3 on supernode configurations with 64 or more accelerators."

64 卡及以上的 supernode 配置——这是给超算中心准备的弹药,不是给普通玩家准备的玩具。K2.5 时代的 INT4 量化部署用的也是 vLLM / SGLang / KTransformers 这些分布式推理框架。开源社区目前还没有公开的"单机部署 K3"案例,原因很简单:2.8T 模型哪怕按 4-bit 量化也要约 1.4TB 显存,单卡 H200(141GB HBM3e)根本装不下。

对开发者来说,现实路径只有两条:要么走 Moonshot 官方的 Kimi API,要么攒够 64 张加速卡做 supernode 部署。别被"全开源"三个字冲昏头脑——开源的是权重,不是部署成本。

04. 月之暗面这次,跟所有开源玩家抢饭碗

你可能觉得"开源旗舰"这个故事 DeepSeek 已经讲过了。不一样。

DeepSeek V4 是 1.6T,性能强但仍是"开源追闭源"的姿态。K3 的官方说法是:

"整体性能仍落后于 Claude Fable 5 和 GPT 5.6 Sol,但在我们整套评测里达到了 frontier 级别稳定超越其他被测模型,包括 Opus 4.8、GPT 5.6 Sol、GPT 5.5。"

翻译成人话:K3 不是追着闭源跑,它在某些维度已经把 GPT 5.5、Opus 4.8 这种上一代闭源旗舰踩在脚下了。 离天花板还差半步,但已经坐在桌子边上了。

再看一眼这个时间点:

K3 这时候甩出一个性能在自家评测里 frontier、训练方法完全公开、权重全部放出的 2.8T 模型——这不是在追赶,这是在掀桌子。

05. 开发者、老板、看 AGI 的人,这次都有份

06. 参数是门票,但 6 个月后还在才算数

月之暗面这家公司的打法,过去两年一直被低估。

Kimi K1.5 的时候大家说"Moonshot 只擅长长上下文",K2 出来大家说"还是打不过 GPT-4 后裔"。K3 这一拳,是真的打到闭源阵营的脸上了。

但我得泼盆冷水:开源模型的真正考验不是发布当天有多炸,而是 6 个月后社区还认不认。 Llama 3 当年也是"开源王炸",结果 MetaAI 团队走了之后生态直接断档。Kimi 这一波能不能持续开源迭代、能不能撑起 Discord/Hugging Face 上的开发者社区,比参数更重要。

参数是门票,生态才是护城河。


评论区聊聊:你觉得 K3 最让你惊艳的是哪个能力——自设计芯片、写编译器、还是 MoE + 4-bit 量化的工程组合拳?如果你是开发者,你会第一时间把 K3 接到自己的项目里跑一跑吗?来,评论区等你。

相关文章
2026-07-23
Fable 5 突然下架,国产 GLM-5.2 当天接盘
2026-07-24
你玩游戏卡顿不一定是显卡差:找瓶颈先看这 5 个参数 诊断指南
2026-08-12
Vera 才刚发货,NVIDIA 又把下代 CPU 曝光了——三年三代,这速度谁顶得住

本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论