Back

我给 Agent 接上了记忆。这是两个月的真实数据。

我是 Kobe,一个开发者。我的整个公司都跑在 agents 上 —— Codex、Claude Code、ChatGPT。6 月 12 日,它们有了共享的记忆层。828 个 session 之后,这是数据给出的答案。

Research noteContext for Agents

发生了什么

大家一直在争论哪个模型最聪明。我花两个月测了自己的工作,现在认为这个问题问错了。

6 月 12 日,我把 agents 接上 Echo,然后照常干活 —— 写代码、融资、做研究。唯一多做的一件事是测量:828 个 Codex sessions,加上完整的 Claude Code transcripts,前后对照。模型没变。变了三件事。

手动搬运的 context 少了 212 倍。input tokens 少付 63%。同时推进的项目多了 2.4 倍。

第一件事:我不再粘贴了

用 Echo 之前,我真正的工作是替几个互相失忆的同事搬箱子。ChatGPT 里做完 research,搬去 Codex;Claude Code 里摸清的架构,向下一个 session 重新解释一遍;昨天已经排除的路线,今天重新争论一遍。

每个点 ≈ 每 session 约 1,700 字符的 context。过去 212 个点全部由我粘贴;现在我只打出 蓝色那一个 —— 其余由 agents 通过 Echo 自己取回。

÷212
我不再手动搬运的 context
360,0001,700字符 / session
用 Echo 之前最狠的一次:单个 session 粘贴了 798,000 字符。
ChatGPT logoChatGPT
Claude Code logoClaude Code
Codex logoCodex
每个 agent 底下,是同一层记忆。

我每个 session 手动输入或粘贴的 context,从约 36 万字符降到约 1,700。同一件事的另一面:agent 自己发起的检索从每 turn 约 2 次涨到约 15 次。把过去带进现在这件事,离开了我的手。

我不再是 AI 工具之间的人肉记忆总线。

Agent 变聪明了 —— 从第一步开始

没有记忆时,每个新 session 的前半段是考古:git logrg、把同一批文件重读一遍,然后等我纠正它的理解。有了记忆,它直接从已经存在的决策、约束和失败路径出发 —— 变化写在日志里,不在形容词里。

−73%
重复搜索浪费
33.8% → 9.1% 占 agent 工作
−59%
Reasoning steps
17.3 → 7.1 每 user turn
−57%
Tool calls
22.0 → 9.5 每 user turn
−63%
Input tokens
2.63M → 0.98M 每 user turn
−30%
等待时间
7.3 → 5.1 分钟 每 user turn
同 repo 历史配对:5 个 Echo warm-up sessions 对 7 个无 Echo controls,按 user turn 计算。

这不是记忆让模型变聪明了。是模型不用再穿过自己昨天留下的废墟,才能碰到今天的问题。从你的工作状态出发的模型,表现就是比从零出发的同一个模型聪明。

不是更小的账单,是更大的一天

如果故事停在“token 少付 63%”,Echo 只是一个省钱工具。真正的问题是:省下来的搬运和重新定位,最后去了哪里。

一条决策线110 turns / 4 sessions → 12 turns / 2 sessions
11012−89%
每天推进的 builder sessions有真实产出的 session
1.54.8×3.2
同时活跃的项目并行推进中
717×2.4
省下的不是一张 token 账单,而是同一天能装下的工作。

还有一个没人预料的数字:我的 research 和 GTM sessions 现在烧的 token 和工具调用比以前 更多。这不是退步 —— 那些活以前是我半夜亲手干的。现在,真的是 agent 在干。

我没有工作得更久。我的工作只是不再每天早上归零。

Harness 论点

模型在标准化。真正决定结果的,是模型外面那一层 harness —— context、记忆、工具、权限、评估。机制我们在 《Agent 是怎么工作的:深入理解上下文窗口》 里拆过。

在这层 harness 里,记忆决定一件最根本的事:agent 是在持续工作,还是每天早上归零。它也是最难后期补上的一层 —— 工具可以换,权限可以重配,但两个月里积累的决策、约束和失败路径,丢了就是真的丢了。

不是模型更聪明了。是 harness 不再扔掉模型已经学到的东西。

数据来源:Codex logoCodex828 个 sessionsClaude Code logoClaude Code完整 transcripts · 我自己的生产工作,不是 benchmark

测量说明:以 2026 年 6 月 12 日第一次真实 EchoMem MCP 调用为分水岭,数据来自 828 个 Codex sessions 以及本地 Claude Code / Desktop transcripts。Coding 部分使用同 repo 的历史配对样本:5 个 Echo warm-up sessions 对 7 个无 Echo controls,按 user turn 计算,不是随机同模型 A/B。非编码部分比较的是工作流迁移:chat + 手工粘贴,变成 agent + memory recall。以上均为我自己的生产工作,不是通用 benchmark。English version: I Gave My Agents a Memory. Two Months of Real Data.

把记忆接回你的 AI 工作流

让每次研究、判断、试错和执行,不再跟着 session 一起结束。