多模态大模型训练,算得快就爆显存,省显存就慢如蜗牛?小红书把 BigMac 开源了,这道选择题不用再做了
多模态大模型训练,算得快就爆显存,省显存就慢如蜗牛?小红书把 BigMac 开源了,这道选择题不用再做了 训练一个多模态大模型有多难?代码可以写,算力可以买,但训练框架长期卡在一个"二选一"的死结上——要么跑得快但显存爆,要么省显存但慢得让人着急。小红书 Dots Infra 团队把这个死结剪开了
💡 你将学到
多模态大模型训练,算得快就爆显存,省显存就慢如蜗牛?小红书把 BigMac 开源了,这道选择题不用再做了 训练一个多模态大模型有多难?代码可以写,算力可以买,但训练框架长期卡在一个"二选一"的死结上——要么跑得快但显存爆,要么省显存但慢得让人着急。小红书 Dots Infra 团队把这个死结剪开了
多模态大模型训练,算得快就爆显存,省显存就慢如蜗牛?小红书把 BigMac 开源了,这道选择题不用再做了
训练一个多模态大模型有多难?代码可以写,算力可以买,但训练框架长期卡在一个"二选一"的死结上——要么跑得快但显存爆,要么省显存但慢得让人着急。小红书 Dots Infra 团队把这个死结剪开了。
7 月 22 日,小红书正式开源了 BigMac,一个专门针对多模态大模型流水线并行训练的新框架。论文已经挂在 arXiv,代码以 MIT 协议在 GitHub 上公开,而且已经在生产环境跑通了。
多模态模型,长什么样?
先拆开一个多模态大模型看看里面有什么。
三块东西:编码器负责把图片、音频转成向量,LLM 主干负责推理,生成器负责把结果输出成图片或语音。
这三块长得很不一样,放进同一个训练流水线里,就出事了。
以前的解法:两条路都走不通
行业里过去有两个选择。
✅ 算力优先方案:把编码器和生成器从 LLM 流水线里拆出来单独跑、并行跑。LLM 不会被拖慢,但显存占用随 batch 规模线性增长——规模一大直接 OOM,卡再多都白搭。
❌ 显存优先方案:三块全塞进同一个流水线串起来跑。显存降下来了,但编码器或生成器一旦慢一步,整个 LLM 都得等着。你想象一下流水线上一个人卡住了,后面所有人干瞪眼——这就是"尾部气泡"。规模越大,空转越严重。
两条路,要么快不住,要么省不快。
BigMac 的解法:不拆,不塞,而是"搭便车"
BigMac 的思路其实很朴素。
LLM 流水线本身已经优化得很成熟了,工业界跑得很稳,没必要推翻重来。那编码器和生成器怎么办?
把它们"嵌套"进 LLM 流水线的自然间隙里。
怎么理解?LLM 有自己的执行节奏,一个批次算完、等下一个批次的时候,流水线里会有一些空闲间隙。BigMac 就在这些间隙里插入编码器和生成器的计算——输入准备好了就插进去算,算完就释放显存,不影响 LLM 主干的节奏。
团队管这个叫"准依赖安全嵌套流水线"。通俗点说:LLM 是主干道,编码器和生成器像搭便车一样,见缝插针,算完就走,不留痕迹。
效果怎么样?
理解型任务(以 Qwen3-30B-A3B 为 backbone,1.3B ViT 编码器): - 比算力优先方案快 1.08~1.1 倍 - 比显存优先方案快 1.6~1.9 倍 - 显存占用随 batch 增加保持稳定,算力优先方案在 batch 一大就爆了
生成型任务(加了 20B 的 MMDiT 生成器): - 算力优先方案在所有 batch 规模下都直接 OOM - BigMac 不仅跑通了,还比显存优先方案快 1.5~1.9 倍
为什么说 BigMac 不是一篇论文,而是一套工具
BigMac 开源了三件东西:
- 调度器:生成全局算子表,覆盖所有流水线阶段、微批次和模块类型
- 执行器:对接 Megatron-Core 等后端,把调度器的计划拆成每个 GPU 的本地执行序列
- 模拟器:不用真跑训练,就能预估不同配置的吞吐和气泡率
算法工程师只需要描述每个模块产生什么、消费什么,剩下的阶段划分、激活值传递、跨设备通信,BigMac 全部接管。一个在单卡上跑通的多模态实验,能更自然地扩展到流水线并行。
一个值得关注的现象
小红书在 AI 基础设施上的投入,这两年越来越有存在感。从 dots.llm1 到 dots.ocr,再到 dots.vlm1,这家以"种草"闻名的公司,在底层技术上走的是另一条路——不光做模型,还在做让模型能跑起来的工具。
BigMac 的开源意味着,不只是小红书能用这套方案,任何做多模态大模型训练的团队都能拿来用。对于正在被显存和速度两头发卡的团队来说,这可能是省下几个月自己造轮子的时间。
你最近训练多模态模型的时候,遇到过显存不够还是速度太慢的困扰?评论区聊聊,看看 BigMac 能不能帮你省点事。
【配图建议】figure-1-bigmac对比.png(算力优先 vs 显存优先 vs BigMac 三方案对比图)插在「以前的解法:两条路都走不通」小标题之前; figure-2-bigmac数据.png(理解型+生成型任务实测数据对比表)插在「效果怎么样?」小标题之前。
本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。
