我给 Agent 接上了记忆。这是两个月的真实数据。
我是 Kobe,一个开发者。我的整个公司都跑在 agents 上 —— Codex、Claude Code、ChatGPT。6 月 12 日,它们有了共享的记忆层。828 个 session 之后,这是数据给出的答案。
发生了什么
大家一直在争论哪个模型最聪明。我花两个月测了自己的工作,现在认为这个问题问错了。
6 月 12 日,我把 agents 接上 Echo,然后照常干活 —— 写代码、融资、做研究。唯一多做的一件事是测量:828 个 Codex sessions,加上完整的 Claude Code transcripts,前后对照。模型没变。变了三件事。
手动搬运的 context 少了 212 倍。input tokens 少付 63%。同时推进的项目多了 2.4 倍。
第一件事:我不再粘贴了
用 Echo 之前,我真正的工作是替几个互相失忆的同事搬箱子。ChatGPT 里做完 research,搬去 Codex;Claude Code 里摸清的架构,向下一个 session 重新解释一遍;昨天已经排除的路线,今天重新争论一遍。
每个点 ≈ 每 session 约 1,700 字符的 context。过去 212 个点全部由我粘贴;现在我只打出 蓝色那一个 —— 其余由 agents 通过 Echo 自己取回。
Claude Code
Codex我每个 session 手动输入或粘贴的 context,从约 36 万字符降到约 1,700。同一件事的另一面:agent 自己发起的检索从每 turn 约 2 次涨到约 15 次。把过去带进现在这件事,离开了我的手。
我不再是 AI 工具之间的人肉记忆总线。
Agent 变聪明了 —— 从第一步开始
没有记忆时,每个新 session 的前半段是考古:git log、rg、把同一批文件重读一遍,然后等我纠正它的理解。有了记忆,它直接从已经存在的决策、约束和失败路径出发 —— 变化写在日志里,不在形容词里。
这不是记忆让模型变聪明了。是模型不用再穿过自己昨天留下的废墟,才能碰到今天的问题。从你的工作状态出发的模型,表现就是比从零出发的同一个模型聪明。
不是更小的账单,是更大的一天
如果故事停在“token 少付 63%”,Echo 只是一个省钱工具。真正的问题是:省下来的搬运和重新定位,最后去了哪里。
还有一个没人预料的数字:我的 research 和 GTM sessions 现在烧的 token 和工具调用比以前 更多。这不是退步 —— 那些活以前是我半夜亲手干的。现在,真的是 agent 在干。
我没有工作得更久。我的工作只是不再每天早上归零。
Harness 论点
模型在标准化。真正决定结果的,是模型外面那一层 harness —— context、记忆、工具、权限、评估。机制我们在 《Agent 是怎么工作的:深入理解上下文窗口》 里拆过。
在这层 harness 里,记忆决定一件最根本的事:agent 是在持续工作,还是每天早上归零。它也是最难后期补上的一层 —— 工具可以换,权限可以重配,但两个月里积累的决策、约束和失败路径,丢了就是真的丢了。
不是模型更聪明了。是 harness 不再扔掉模型已经学到的东西。
数据来源:
Codex828 个 sessions
Claude Code完整 transcripts · 我自己的生产工作,不是 benchmark
测量说明:以 2026 年 6 月 12 日第一次真实 EchoMem MCP 调用为分水岭,数据来自 828 个 Codex sessions 以及本地 Claude Code / Desktop transcripts。Coding 部分使用同 repo 的历史配对样本:5 个 Echo warm-up sessions 对 7 个无 Echo controls,按 user turn 计算,不是随机同模型 A/B。非编码部分比较的是工作流迁移:chat + 手工粘贴,变成 agent + memory recall。以上均为我自己的生产工作,不是通用 benchmark。English version: I Gave My Agents a Memory. Two Months of Real Data.