Google 开源 Gemma 4 12B:专为 16G 显存的无编码器多模态模型
今天,Google 在 Gemma 4 家族中推出了一个全新的成员——Gemma 4 12B。
💡 你将学到
今天,Google 在 Gemma 4 家族中推出了一个全新的成员——Gemma 4 12B。
今天,Google 在 Gemma 4 家族中推出了一个全新的成员——Gemma 4 12B。
这个模型跟之前 4 月份发布的 Gemma 4 系列(E2B、E4B、26B-A4B、31B)不同,它是一个 12B 参数的稠密模型,主打一个核心场景:在 16G 显存的笔记本上本地跑多模态推理。
UnslothAI 已经同步放出 GGUF 量化版,可以开箱即用。
01. 什么叫"无编码器"?为什么很重要?
这是这篇推文最值得搞懂的一个概念。
传统的多模态模型,处理一张图片是这样的流程:
图片 → 视觉编码器(如 SigLIP/CLIP,150M~550M 参数)→ 提取特征向量 → 送入 LLM
处理音频也一样:音频 → 音频编码器(300M 参数)→ 提取特征 → 送入 LLM
Gemma 4 12B 把这层中间商跳过了。
图片和音频数据直接喂进 LLM 的主干网络,由 Transformer 自己学习如何理解这些非文本输入。不需要单独的 SigLIP 视觉塔、不需要独立的音频编码器——**整个模型就是一个统一的 Tr
相关文章
相关文章
2026-07-28
Sakana Fugu:把多智能体编排做成单模型,日本换了一条赛道
2026-07-13
标题:Intel Nova Lake曝光!52核700W,Z990配TB5,2027硬刚Zen 6
2026-07-21
微软在 Windows 里埋了一个 Agent 系统,终端只是第一站
本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。
