多模态大模型训练,算得快就爆显存,省显存就慢如蜗牛?小红书把 BigMac 开源了,这道选择题不用再做了

📡 AI新闻 2026-08-22 约 1 分钟阅读

多模态大模型训练,算得快就爆显存,省显存就慢如蜗牛?小红书把 BigMac 开源了,这道选择题不用再做了 训练一个多模态大模型有多难?代码可以写,算力可以买,但训练框架长期卡在一个"二选一"的死结上——要么跑得快但显存爆,要么省显存但慢得让人着急。小红书 Dots Infra 团队把这个死结剪开了

💡 你将学到

多模态大模型训练,算得快就爆显存,省显存就慢如蜗牛?小红书把 BigMac 开源了,这道选择题不用再做了 训练一个多模态大模型有多难?代码可以写,算力可以买,但训练框架长期卡在一个"二选一"的死结上——要么跑得快但显存爆,要么省显存但慢得让人着急。小红书 Dots Infra 团队把这个死结剪开了

📜 目录

多模态大模型训练,算得快就爆显存,省显存就慢如蜗牛?小红书把 BigMac 开源了,这道选择题不用再做了

训练一个多模态大模型有多难?代码可以写,算力可以买,但训练框架长期卡在一个"二选一"的死结上——要么跑得快但显存爆,要么省显存但慢得让人着急。小红书 Dots Infra 团队把这个死结剪开了。

7 月 22 日,小红书正式开源了 BigMac,一个专门针对多模态大模型流水线并行训练的新框架。论文已经挂在 arXiv,代码以 MIT 协议在 GitHub 上公开,而且已经在生产环境跑通了。

多模态模型,长什么样?

先拆开一个多模态大模型看看里面有什么。

三块东西:编码器负责把图片、音频转成向量,LLM 主干负责推理,生成器负责把结果输出成图片或语音。

这三块长得很不一样,放进同一个训练流水线里,就出事了。

以前的解法:两条路都走不通

行业里过去有两个选择。

算力优先方案:把编码器和生成器从 LLM 流水线里拆出来单独跑、并行跑。LLM 不会被拖慢,但显存占用随 batch 规模线性增长——规模一大直接 OOM,卡再多都白搭。

显存优先方案:三块全塞进同一个流水线串起来跑。显存降下来了,但编码器或生成器一旦慢一步,整个 LLM 都得等着。你想象一下流水线上一个人卡住了,后面所有人干瞪眼——这就是"尾部气泡"。规模越大,空转越严重。

两条路,要么快不住,要么省不快。

BigMac 的解法:不拆,不塞,而是"搭便车"

BigMac 的思路其实很朴素。

LLM 流水线本身已经优化得很成熟了,工业界跑得很稳,没必要推翻重来。那编码器和生成器怎么办?

把它们"嵌套"进 LLM 流水线的自然间隙里。

怎么理解?LLM 有自己的执行节奏,一个批次算完、等下一个批次的时候,流水线里会有一些空闲间隙。BigMac 就在这些间隙里插入编码器和生成器的计算——输入准备好了就插进去算,算完就释放显存,不影响 LLM 主干的节奏。

团队管这个叫"准依赖安全嵌套流水线"。通俗点说:LLM 是主干道,编码器和生成器像搭便车一样,见缝插针,算完就走,不留痕迹。

效果怎么样?

理解型任务(以 Qwen3-30B-A3B 为 backbone,1.3B ViT 编码器): - 比算力优先方案快 1.08~1.1 倍 - 比显存优先方案快 1.6~1.9 倍 - 显存占用随 batch 增加保持稳定,算力优先方案在 batch 一大就爆了

生成型任务(加了 20B 的 MMDiT 生成器): - 算力优先方案在所有 batch 规模下都直接 OOM - BigMac 不仅跑通了,还比显存优先方案快 1.5~1.9 倍

为什么说 BigMac 不是一篇论文,而是一套工具

BigMac 开源了三件东西:

算法工程师只需要描述每个模块产生什么、消费什么,剩下的阶段划分、激活值传递、跨设备通信,BigMac 全部接管。一个在单卡上跑通的多模态实验,能更自然地扩展到流水线并行。

一个值得关注的现象

小红书在 AI 基础设施上的投入,这两年越来越有存在感。从 dots.llm1 到 dots.ocr,再到 dots.vlm1,这家以"种草"闻名的公司,在底层技术上走的是另一条路——不光做模型,还在做让模型能跑起来的工具。

BigMac 的开源意味着,不只是小红书能用这套方案,任何做多模态大模型训练的团队都能拿来用。对于正在被显存和速度两头发卡的团队来说,这可能是省下几个月自己造轮子的时间。


你最近训练多模态模型的时候,遇到过显存不够还是速度太慢的困扰?评论区聊聊,看看 BigMac 能不能帮你省点事。


【配图建议】figure-1-bigmac对比.png(算力优先 vs 显存优先 vs BigMac 三方案对比图)插在「以前的解法:两条路都走不通」小标题之前; figure-2-bigmac数据.png(理解型+生成型任务实测数据对比表)插在「效果怎么样?」小标题之前。

相关文章
2026-08-14
TTS 成本对比 2026:云 vs 本地,每 100 万字符
2026-07-11
三款本地AI迷你机横评:RTX Spark全网被吹爆,但跑大模型它可能连第二都排不上
2026-08-15
昨天那个把 Agent 跑上头条的人,今天因为 Agent 上头条了

本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论