Hermes 0.18 "审判版"发布:AI 智能体学会证明自己干完了活
Hermes 0.18 "审判版"发布:AI 智能体学会证明自己干完了活 这几天 AI 圈最热闹的事之一,是 Nous Research 发布了 Hermes Agent v0.18.0(The Judgment Release)。 名字起得很重——"审判版"。 为什么叫这个名?因为团队在发布
Hermes 0.18 "审判版"发布:AI 智能体学会证明自己干完了活
这几天 AI 圈最热闹的事之一,是 Nous Research 发布了 Hermes Agent v0.18.0(The Judgment Release)。
名字起得很重——"审判版"。
为什么叫这个名?因为团队在发布前的 12 天里干了一件狠事:把整个仓库的 P0 和 P1 问题全部清零。 700 个最高优先级 issues + PRs,一个不剩,全部解决。还立了 flag:以后保持零。
这版更新的数据量也很吓人:1720 个 commit、998 个合并 PR、25 万行新增代码、949 个 issue 关闭、381 位贡献者。
但数字是数字,真正让我觉得有意思的,是这版背后的三个信号。
12 天清掉 700 个高优问题,怎么做到的?
Hermes Agent 是 Nous Research 的开源 AI 智能体框架,能跑在终端、桌面、IDE 和各路聊天平台,20.7 万个 GitHub Star,生态已经不小了。
项目大到一定程度,bug backlog 自然膨胀。很多开源项目走到这一步会默认接受"修不完",维持一个漫长的待办队列。
但 Nous 团队在这个版本里做了一个激进的决定:All hands on deck,把所有 P0(崩溃级别)和 P1(功能阻塞)问题全部吃掉。
最终数量:
- P0 关闭 11 个(3 issues + 8 PRs)
- P1 关闭 681 个(493 issues + 188 PRs)
- 合计 ~692 个高优项目,12 天清零
最后一个被啃掉的硬骨头——中断保护与压缩的 fork 冲突 Bug(#56391),是发布前一晚通宵搞定的。
这事的启示不在于"他们很努力",而在于:当一个开源项目把"质量债"作为优先级排到新功能前面时,是可以做到的。 只是绝大多数团队不这么选。
MoA 从"实验模式"变成了一等公民
Mixture-of-Agents——说白了,就是让多个大模型组成一个"委员会",一起讨论你的问题,然后汇总出答案。
以前 Hermes 的 MoA 是一个需要手动开启的模式。v0.18 里,每个 MoA 预设直接变成了一个可选模型。你在模型选择器里选"my-council",和选 Claude、GPT 一样自然,Hermes 自动把问题路由到你的模型委员会。
更狠的是,每个参考模型的推理过程现在单独展示——GPT-5 怎么想的、Claude 怎么想的、Grok 怎么想的,各自一个标签页。最后的聚合答案还 实时流式输出,不用等半天突然冒出一大段。
也就是说,你不但能看到"委员会得出了什么结论",还能看到每一个"委员"投了什么票、为什么这么投。
这对那些需要多角度交叉验证的复杂问题——代码审查、系统架构设计、策略分析——帮助很大。
智能体终于学会证明自己完成了工作
这个才是我觉得这版最被低估的升级。
以前 AI 智能体做一件事,你说"修这个 Bug",它跑几圈,说"修好了"。你信不信?没法信。它自己也说不清到底有没有真的修好。
v0.18 引入了 完成合约(completion contracts)——给你的 /goal 配上明确的"完成标准"。Hermes 会去实际跑你的测试、检查证据,而不是凭模型自己的判断说"干完了"。
区别就像:
- ❌ "我觉得我修好了"
- ✅ "测试通过了,代码审查过了,CI 绿了,证据在这"
它还加了一个 pre_verify 钩子,你可以自己接自定义校验流程。
这件事为什么重要?因为 AI 智能体能不能真的"干活",核心瓶颈从来不是"能不能干",而是"干完没有"。一个不验证自己输出的智能体,本质上就是个会说漂亮话的实习生。
/learn 和 /journey:让智能体的记忆不再是黑箱
这两个命令是配套的。
/learn <anything>——你对 Hermes 说"学会这个",它就把你指的东西——一个目录、一个工作流、一个 URL——自动提炼成一个可复用的 Skill。下一次你需要同样的操作,直接调 Skill 就行。
/journey——在 CLI 和桌面端打开一个学习时间线,展示 Hermes 在和你互动的过程中积累了多少记忆和技能。你可以直接在视图里编辑或删除它们。
桌面端还加了一个记忆图谱,像一个可交互的径向时间线,把你智能体的成长过程可视化。
帮你理清 Agent 脑子里装着什么,把黑箱变成了透明的。
桌面端真成了"编程驾驶舱"
Hermes Desktop 这次加了原生 Projects 功能——侧边栏管理你的代码库、review 面板、git 工作树管理、多终端面板。会话不散了,项目有组织了。
还有小细节:推理过程可以语音朗读(auto-TTS 开关)、窗口大小位置跨启动记忆、PR 风格的文件差异对比直接嵌在聊天里。
对高频用户来说,这些体验打磨比功能堆砌更值钱。
还有几个值得提的
- 后台扇出(background fan-out):
delegate_task同时派出多个子代理干活,它们在后台跑,你的聊天不阻塞。等所有子代理干完,一次汇总回来。适合"同时调研五个竞品"这类场景 - Google Vertex AI 成为一等公民:如果你用 Gemini 但走的是 GCP 企业账号——不再需要手动倒腾短期 Token,Hermes 自动处理和刷新
- 网关 scale-to-zero:没人聊天时自动休眠,有人来了再唤醒。跑在云上的托管 Hermes 可以真正做到"不聊天不花钱"
- 安全加固:MCP 配置持久化防篡改、cron 的 base_url 注入加固、Slack xapp- Token 自动脱敏,等等
个人观点
Hermes Agent 这次版本的标题叫"The Judgment Release",但最像"审判"的不是清零 P0/P1,也不是 MoA 转正。
最像审判的,是那个"自我验证"机制。
一个 AI 智能体什么时候真正能从"辅助工具"变成"可信的劳动者"?不是它变得多聪明,而是它能对自己说"我干完了,这是证据"。
这次升级让我看到的不是"Hermes 又加了什么功能",而是 Nous Research 在认真思考 AI Agent 怎么才算可靠。功能谁都能加,但让 Agent 学会对自己负责——这是少数团队才愿意啃的硬骨头。
你觉得 AI 智能体什么时候才能真正可信?是靠自我验证,还是靠别的?评论区聊聊。
