用MLflow做LLMOps:追踪提示词、评估模型、上线生产

📘 教程 2026-08-02 约 5 分钟阅读

三个提示词版本加两个模型,你已经记不清上周的好结果来自哪组组合。

💡 你将学到

三个提示词版本加两个模型,你已经记不清上周的好结果来自哪组组合。

📜 目录

标题:LLMOps 与 MLflow:追踪提示词、评估模型并交付生产(27k Stars)

LLMOps:MLflow 为 LLM 应用所做的工作

MLflow 最初是一个机器学习实验追踪器,自 2.x 版本以来,已成为整个 LLM 生命周期中使用最广泛的开源平台。它在 GitHub 上拥有 27,318 颗星(2026 年 8 月),采用 Apache-2.0 许可证,解决了一个具体问题:让每个提示词-模型-数据组合都可复现。

你将实际使用的四个部分

1. 实验追踪。 每次运行都会记录提示词模板、模型 ID、温度参数和评估指标。三周后,你可以通过几次点击,将使用精简提示词的 gpt-4o 与使用冗长提示词的 claude 进行比较。

2. 提示词管理。 提示词作为版本化的制品存在于 MLflow 的注册表中。当提示词发生变化时,你会获得一个新版本并附带差异对比——不再有 prompt_v7_final_REAL 这样的文件。

3. 模型评估。 MLflow 内置了 LLM 作为裁判的评估功能:你提供一个测试数据集,它会对不同模型版本的准确性、有害性和答案相关性进行评分。这能将“我觉得效果变好了”转化为具体的数字。

4. 模型注册表。 经过批准的提示词和模型通过 staging 阶段提升到生产环境。部署从注册表中读取,因此回滚只需更改一个标签。

一个切实可行的第一步

import mlflow

with mlflow.start_run():
    mlflow.log_param("prompt_version", "v3")
    mlflow.log_param("model", "gpt-4o")
    mlflow.log_metrics(evaluate_on_testset(prompt_v3))

在一个应用上坚持这样做一周。记录每次实验的习惯比任何 MLflow 的单个功能都更有价值。

与 Langfuse / Phoenix 的定位对比

MLflow 是重量级的生命周期平台(如果你已经为传统 ML 使用 MLflow,那么它很适合你)。Langfuse 和 Arize Phoenix 是更轻量、专为 LLM 设计的可观测性工具,具有更深入的追踪能力。2026 年的实用模式:使用 MLflow 进行实验和注册表管理,使用追踪工具进行生产调试。

常见问题

MLflow 是免费的吗? 是的,开源。Databricks 提供托管版本。

它可以在单台服务器上运行吗? 可以,追踪服务器可以轻松在单台机器上运行。

它支持本地 LLM 吗? 支持,任何模型都可以注册,本地端点也可以作为评估目标。

对于单个应用来说,它是否大材小用? 对于单个提示词,是的。但对于运行多个应用的团队,它在一周内就能收回成本。

相关文章

❓ 常见问题

Is MLflow free?

Yes, open source. Databricks offers a hosted version.

Can it run on one server?

Yes, the tracking server runs on a single box easily.

Does it support local LLMs?

Yes, any model can be registered, and local endpoints work as evaluation targets.

Is it overkill for one app?

For one prompt, yes. For teams running multiple apps, it pays for itself in a week.

相关文章
2026-07-20
llama.cpp优化技巧:在CPU和GPU上加速本地LLM推理
2026-08-11
MLOps工具盘点2026:覆盖全流程的12个开源项目
2026-08-11
LLM微调数据标注2026:Label Studio、LLM辅助标注与质量控制

本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论