Databricks Mosaic AI模型服务2026:配置、定价与何时胜过自托管
Databricks把Mosaic AI Model Serving宣传为服务开源模型的托管方式。文档很密。这篇提炼它花多少钱、怎么工作、什么时候真的胜过自建GPU。
💡 你将学到
Databricks把Mosaic AI Model Serving宣传为服务开源模型的托管方式。文档很密。这篇提炼它花多少钱、怎么工作、什么时候真的胜过自建GPU。
Mosaic AI Model Serving是什么
Mosaic AI Model Serving是Databricks的托管推理平台:你把模型指给它(Llama、Qwen这类开放权重,或你自己训练跑的微调版),GPU、伸缩、API它全管。按token或按预留吞吐付费,不按月租GPU。
怎么工作
在Unity Catalog(Databricks的治理层)注册模型;选服务类型——serverless按token付费、自动缩到零,或预留吞吐、适合稳定负载;Databricks部署推理栈(底层支持vLLM式引擎)并暴露OpenAI兼容端点;你的应用调端点,指标流回工作区。
定价现实(2026)
Serverless按每百万token(输入/输出)加每个端点的少量基础费计费。预留吞吐按吞吐单元计费——你承诺一个速率,用不用都付预留费。实用模式:波动或新负载用serverless,流量稳定后转预留拿更低的单token成本。
什么时候胜过自托管
已经是Databricks客户——数据、治理、服务在一个地方,不引新供应商。流量波动——serverless缩到零,闲置GPU账单消失。团队没有GPU运维技能——没有Kubernetes、没有vLLM配置、没有驱动更新。微调模型来自自己的数据——训练和服务同平台,Unity Catalog权限强制执行。
什么时候自托管胜出
稳定高流量——7B级模型专用GPU集群每小时约1-2美元,能大幅低于按token定价。数据驻留和隐私——推理请求会离开你的环境。成本可预测性——按token简单,直到量暴涨,账单吓人。
决策规则
算盈亏平衡:估计每月稳定token数,两边报价,加运维时间。流量波动或团队没有GPU运维,托管赢;稳定流量加有人能跑服务器,自托管成本赢。
FAQ
任何模型都能serve吗? 开放权重和Databricks训练的模型可以;GPT、Claude这类专有API是作为外部端点集成,不是托管。 支持OpenAI兼容API吗? 支持,端点说OpenAI协议,客户端库原样工作。 有免费档吗? 新工作区通常有试用额度,查当前条款。
