Hermes 0.18 "审判版"发布:AI 智能体学会证明自己干完了活

📡 AI新闻 2026-08-03 约 1 分钟阅读

Hermes 0.18 "审判版"发布:AI 智能体学会证明自己干完了活 这几天 AI 圈最热闹的事之一,是 Nous Research 发布了 Hermes Agent v0.18.0(The Judgment Release)。 名字起得很重——"审判版"。 为什么叫这个名?因为团队在发布

Hermes 0.18 "审判版"发布:AI 智能体学会证明自己干完了活

这几天 AI 圈最热闹的事之一,是 Nous Research 发布了 Hermes Agent v0.18.0(The Judgment Release)

名字起得很重——"审判版"。

为什么叫这个名?因为团队在发布前的 12 天里干了一件狠事:把整个仓库的 P0 和 P1 问题全部清零。 700 个最高优先级 issues + PRs,一个不剩,全部解决。还立了 flag:以后保持零。

这版更新的数据量也很吓人:1720 个 commit、998 个合并 PR、25 万行新增代码、949 个 issue 关闭、381 位贡献者

但数字是数字,真正让我觉得有意思的,是这版背后的三个信号。


12 天清掉 700 个高优问题,怎么做到的?

Hermes Agent 是 Nous Research 的开源 AI 智能体框架,能跑在终端、桌面、IDE 和各路聊天平台,20.7 万个 GitHub Star,生态已经不小了。

项目大到一定程度,bug backlog 自然膨胀。很多开源项目走到这一步会默认接受"修不完",维持一个漫长的待办队列。

但 Nous 团队在这个版本里做了一个激进的决定:All hands on deck,把所有 P0(崩溃级别)和 P1(功能阻塞)问题全部吃掉。

最终数量:

最后一个被啃掉的硬骨头——中断保护与压缩的 fork 冲突 Bug(#56391),是发布前一晚通宵搞定的。

这事的启示不在于"他们很努力",而在于:当一个开源项目把"质量债"作为优先级排到新功能前面时,是可以做到的。 只是绝大多数团队不这么选。


MoA 从"实验模式"变成了一等公民

Mixture-of-Agents——说白了,就是让多个大模型组成一个"委员会",一起讨论你的问题,然后汇总出答案。

以前 Hermes 的 MoA 是一个需要手动开启的模式。v0.18 里,每个 MoA 预设直接变成了一个可选模型。你在模型选择器里选"my-council",和选 Claude、GPT 一样自然,Hermes 自动把问题路由到你的模型委员会。

更狠的是,每个参考模型的推理过程现在单独展示——GPT-5 怎么想的、Claude 怎么想的、Grok 怎么想的,各自一个标签页。最后的聚合答案还 实时流式输出,不用等半天突然冒出一大段。

也就是说,你不但能看到"委员会得出了什么结论",还能看到每一个"委员"投了什么票、为什么这么投

这对那些需要多角度交叉验证的复杂问题——代码审查、系统架构设计、策略分析——帮助很大。


智能体终于学会证明自己完成了工作

这个才是我觉得这版最被低估的升级

以前 AI 智能体做一件事,你说"修这个 Bug",它跑几圈,说"修好了"。你信不信?没法信。它自己也说不清到底有没有真的修好。

v0.18 引入了 完成合约(completion contracts)——给你的 /goal 配上明确的"完成标准"。Hermes 会去实际跑你的测试、检查证据,而不是凭模型自己的判断说"干完了"。

区别就像:

它还加了一个 pre_verify 钩子,你可以自己接自定义校验流程。

这件事为什么重要?因为 AI 智能体能不能真的"干活",核心瓶颈从来不是"能不能干",而是"干完没有"。一个不验证自己输出的智能体,本质上就是个会说漂亮话的实习生。


/learn/journey:让智能体的记忆不再是黑箱

这两个命令是配套的。

/learn <anything>——你对 Hermes 说"学会这个",它就把你指的东西——一个目录、一个工作流、一个 URL——自动提炼成一个可复用的 Skill。下一次你需要同样的操作,直接调 Skill 就行。

/journey——在 CLI 和桌面端打开一个学习时间线,展示 Hermes 在和你互动的过程中积累了多少记忆和技能。你可以直接在视图里编辑或删除它们。

桌面端还加了一个记忆图谱,像一个可交互的径向时间线,把你智能体的成长过程可视化。

帮你理清 Agent 脑子里装着什么,把黑箱变成了透明的。


桌面端真成了"编程驾驶舱"

Hermes Desktop 这次加了原生 Projects 功能——侧边栏管理你的代码库、review 面板、git 工作树管理、多终端面板。会话不散了,项目有组织了。

还有小细节:推理过程可以语音朗读(auto-TTS 开关)、窗口大小位置跨启动记忆、PR 风格的文件差异对比直接嵌在聊天里。

对高频用户来说,这些体验打磨比功能堆砌更值钱。


还有几个值得提的


个人观点

Hermes Agent 这次版本的标题叫"The Judgment Release",但最像"审判"的不是清零 P0/P1,也不是 MoA 转正。

最像审判的,是那个"自我验证"机制。

一个 AI 智能体什么时候真正能从"辅助工具"变成"可信的劳动者"?不是它变得多聪明,而是它能对自己说"我干完了,这是证据"

这次升级让我看到的不是"Hermes 又加了什么功能",而是 Nous Research 在认真思考 AI Agent 怎么才算可靠。功能谁都能加,但让 Agent 学会对自己负责——这是少数团队才愿意啃的硬骨头。


你觉得 AI 智能体什么时候才能真正可信?是靠自我验证,还是靠别的?评论区聊聊。

相关文章
2026-08-03
索尼PlayStation将在2028年停掉实体游戏光盘,PS6或成纯数字主机
2026-08-03
把你的电脑打造成"末日数据堡垒""离线AI库",3万人已上车
2026-08-03
我搭了一套AI Agent穷鬼套餐,欢迎抄作业

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论