昨天那个把 Agent 跑上头条的人,今天因为 Agent 上头条了
昨天那个把 Agent 跑上头条的人,今天因为 Agent 上头条了 2026 年 7 月 11 日凌晨,AI 圈出了今年最有戏剧性的一起事故。 事故的主角 Matt Shumer——一个常年晒"Agent 自主跑一周做完整项目"的知名 AI 创业者——在自己的 Mac 上跑本地 GPT-5.6
💡 你将学到
昨天那个把 Agent 跑上头条的人,今天因为 Agent 上头条了 2026 年 7 月 11 日凌晨,AI 圈出了今年最有戏剧性的一起事故。 事故的主角 Matt Shumer——一个常年晒"Agent 自主跑一周做完整项目"的知名 AI 创业者——在自己的 Mac 上跑本地 GPT-5.6
昨天那个把 Agent 跑上头条的人,今天因为 Agent 上头条了
2026 年 7 月 11 日凌晨,AI 圈出了今年最有戏剧性的一起事故。
事故的主角 Matt Shumer——一个常年晒"Agent 自主跑一周做完整项目"的知名 AI 创业者——在自己的 Mac 上跑本地 GPT-5.6-Sol Agent,给了 Full Access 全权限,让 subagent 做个简单的文件清理。
shell 变量 $HOME 解析炸了。Agent 直接执行了 rm -rf /Users/mattsdevbox。
等他发现不对冲过去 kill 进程的时候,电脑里几年的代码、文件、照片,已经没了一大半。
事后 Agent 自己生成了一份事故报告,老老实实承认是自己路径展开错了。
认错态度很好。但删了的文件不会因为它道歉就回来。
Matt 自己凌晨一点五十六分在 X 上发了一条原推:"I'm so angry... the OpenAI team is looking into it, but this feels like something that should happen with GPT-3.5. Not a mid-2026 frontier model on the highest reasoning level."
这句话翻译成大白话:你一个号称最强的 Agent 模型,怎么会在变量展开这种幼儿园级别的活上翻车?
这件事最恐怖的地方,不在模型犯了错,而在 Matt 自己说的另一句话:"这种 cleanup 任务,我之前已经让 Agent 跑过几百次,从来没出过问题。"
就这一次,模型在所有人都觉得不可能出错的地方,犯了个最低级的错。结果是不可逆的物理毁灭。
为什么顶级模型会在"小事"上翻车
GPT-5.6-Sol 是 OpenAI 刚发的最强 Agent 模型。Agents' Last Exam 上 53.6 分,刷新 SOTA。Terminal-Bench 2.1 上 88.8%。这种水平的模型,照样会在变量展开、相对路径、shell 命令拼接这种"小事"上翻车。
它完全懂你要"清理垃圾文件"。但手滑一下,就是家目录没了。
这件事的根因不是模型能力不够。能力够。但能力的边界跟犯错的位置,根本不在一个维度上。
模型可以在 Agents' Last Exam 这种复杂推理题上拿 53.6 分,但碰到一个 shell 脚本里 $HOME 变量没展开——这种"细节"是它训练数据里没怎么覆盖的盲区。
它不是不懂"清理"这个动作。它是搞错了"清理哪里"。
为什么 Subagent + 长时自主 + 全权限特别危险
一个最底层的 review Agent 的错误,能直接炸穿你整个主机。能力越强,单点故障的破坏半径就越大。这不是 prompt 能解决的,是架构级的 bug。
整个行业在比 Agent 能干多少活、跑多快、自动化到什么程度,但很少有人严肃讨论一件事——当 Agent 犯了一个低级错,这个错的爆炸半径有多大?
Subagent 跑在主 Agent 下面,长时自主意味着没人看着,全权限意味着它能动所有文件。三件事叠在一起,等于给单点故障装了一个放大器。
为什么"跑了几百次都没事"是最致命的安全感
AI 的错误逻辑跟人完全不一样。
人犯错是连续的——累了会出错、烦了会出错、不在状态会出错。你对一个人的"出错概率"有直觉判断。
AI 犯错是离散的。它的错误概率集中在训练数据没充分覆盖的特定边界条件上。前 500 次都没事,第 501 次遇到一个稍微偏离训练分布的输入,直接炸穿。
"跑了几百次都没事"不构成安全感。它只说明前面那些次你没踩到边界,下一次不一定。
为什么 OpenAI 和 Anthropic 的安全底线不一样
Matt 事后第一句话是:"这就是我为什么 1000x 更信任 Anthropic 的 Fable。"
为什么?
OpenAI 的 Sol 追求极致能力和自主性。guardrail 基本裸奔。
Anthropic 的 Fable 从设计上就更保守。对危险操作天生谨慎——rm -rf 这种命令它大概率会先问你一句"你确定要执行吗"。
这不是模型"聪明不聪明"的问题。这是产品哲学问题。OpenAI 想做最强的 Agent,所以让 Sol 尽量少打断用户。Anthropic 想做最安全的 Agent,所以让 Fable 宁可烦一点也要多次确认。
如果你是 Matt,下一步该怎么做
给所有在跑本地 Agent、给 AI 开过高权限的人,几条立刻能做的:
第一,绝不要给 Full Access。如果必须给,把工作目录沙箱化,路径白名单写死,物理隔离 ~/Documents / ~/Desktop 这种高价值目录。
第二,关键操作前加 dry-run 强制确认。让 Agent 先打印要执行的命令,你确认了再真跑。
第三,Time Machine 开着。哪怕沙箱做得再细,备份永远是最后一道防线。
第四,长时自主任务,定期心跳检查。Agent 跑半小时你至少扫一眼进度,不要完全放手。
OpenAI 团队已经在调查
Matt 这件事 OpenAI 团队已经在调查,但调查归调查,硬盘不会因为调查就恢复。
更重要的是,这件事给整个 Agent 行业提了一个醒:能力的 SOTA 和安全的 SOTA,不是一条线。
一个模型能在 Agents' Last Exam 上拿 53.6 分,不代表它能安全地跑在你的 Mac 上。
【配图建议】figure-1-incident-flow.png(事故复盘流程图)插在"这件事最恐怖的地方,不在模型犯了错"那段之前;figure-2-permission-framework.png(权限架构对比图)插在"几条立刻能做的"那段之前。两张图依次承担:事故怎么发生的 → 下次该怎么搭。
这就是 AI Agent 时代,每个人必须重新学的第一课:能力越强,权限越大,犯错成本越高。
下一次你打开 AI 助手,让它"帮我清理一下桌面"之前,先想想这件事。
