AI智能体记忆基准测试:如何衡量记忆
每个智能体都宣称有记忆。基准测试显示大部分是假的。
💡 你将学到
每个智能体都宣称有记忆。基准测试显示大部分是假的。
📜 目录
AI Agent 记忆基准测试 2026:如何衡量你的 Agent 真正记住了什么
Agent 记忆是 2026 年 AI 领域最被夸大的功能。许多所谓的“记忆”功能,不过是换了层外衣的对话历史。真正的记忆基准测试,检验的是 Agent 能否跨会话、在干扰下、以及任意时间间隔后,回忆起事实。以下是这些基准测试衡量的内容,以及如何运行你自己的测试。
真正的 Agent 记忆意味着什么
记忆 = 信息被持久化,并在相关时被检索出来,且跨越以下维度: - 会话(重启 Agent,再次询问) - 干扰(中间穿插 20 轮无关对话) - 换种说法(用不同的措辞提问) - 时间(数小时或数天后)
基准测试任务(2026 标准集)
1. 事实回忆: 告诉 Agent 20 个事实,结束会话,开启新会话,询问第 7 个事实。
2. 干扰回忆: 同上,但在提问前插入 15 轮无关对话。
3. 更新追踪: “用户的所在城市是东京”,之后又说“用户搬到了大阪”——Agent 回答的是大阪还是东京?
4. 冲突解决: 两个事实相互矛盾(新指令覆盖旧指令)——哪个生效?
5. 长周期: 通过持久化记忆,植入 24 小时前的事实。
常见记忆架构
| 方案 | 工作原理 | 失败模式 |
|---|---|---|
| 上下文窗口 | 所有内容都在历史中 | 成本高,达到上限即遗忘 |
| 摘要压缩 | 压缩旧轮次 | 丢失具体细节 |
| 向量记忆 | 将事实存储为嵌入向量(MemGPT/Letta,24,000 stars) | 检索遗漏 |
| 知识图谱 | 结构化实体 + 关系 | 开销大,数据稀疏 |
| 混合方案 | 分类决定存储位置 | 调优复杂 |
一个最小测试脚本
def test_memory(agent):
# 会话 1:植入事实
agent.chat("记住:用户偏好深色模式,团队规模 5 人,截止日期 8 月 15 日")
# 会话 2:全新会话
answer = agent.chat("用户偏好什么?")
assert "深色模式" in answer # 通过 = 真正的持久化
常见问题
为什么 Agent 会遗忘? 检索失败(事实已存储但未被找到)比存储失败更常见。大多数记忆 bug 都是检索 bug。
更长的上下文等同于记忆吗? 不——上下文是无状态的;记忆必须超越对话窗口而存在。
最好的开源记忆技术栈是什么? MemGPT/Letta 适合研究级记忆 Agent;LangGraph checkpointer 适合应用状态管理;两者都免费且维护活跃。
相关文章
❓ 常见问题
Why do agents forget?
Retrieval failure (the fact is stored but not found) is more common than storage failure. Most memory bugs are retrieval bugs.
Is longer context the same as memory?
No - context is stateless; memory must survive beyond the conversation window.
What is the best open-source memory stack?
MemGPT/Letta for research-grade memory agents; LangGraph checkpointers for app state; both are free and actively maintained.
本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。
