Cal Paterson这周在自己的博客上甩出一个野心不大的东西:一个agent记忆的文件格式规范,叫memoryfield。说它野心不大,是因为它反着现在整个agent记忆赛道在做的事——别人在堆图数据库、堆专门的LLM做记忆筛选,他直接把记忆做成一个zip包:几个Markdown文件,加一个可选的SQLite向量索引。没有流水线,没有后台服务,没有平台锁定。这背后其实是一个更大的分歧:agent的记忆,到底该不该有结构?

一个zip包,三个被打的对象

memoryfield的结构很朴素:Markdown页面+可选YAML frontmatter(记title、uuid、summary、created、updated)+可选的SQLite向量索引,默认用nomic-embed-text-v1.5生成768维向量。整个包可以是zip,也可以放S3、GitHub或本地文件夹,怎么传都行。

Paterson把这套简单方案立在了三类现有系统的对面。第一类是模型厂商自带的记忆功能,本质是从对话历史里挖用户信息,目的是把生意从"卖API"改成"卖平台",记的大多是"关于你"而不是"关于世界"的东西。第二类是重型系统,同时用pgvector、Neo4j图数据库,还得配一个专门的LLM来判断什么值得记——他的判断是这类系统不仅难运维,还会把模型本身搞糊涂。第三类他称作"高级理性主义"派:把记忆硬拆成图节点或逻辑命题,信息被剥离上下文后变得孤立无意义。

他引用了软件工程老将Brooks的一句话:"给我看你的表格,别给我看你的流程图,你的表格会自己说话。"落到agent记忆上就是——记忆该是数据,不该是处理流程。

语义跳转,而不是图上爬行

Paterson还对着Karpathy此前提出的互链Markdown"wiki"式记忆下了刀。那套方案让agent像人逛Obsidian笔记一样,顺着链接一页页找。问题是每跳一页就要停下来发一次工具调用,如果相关信息藏在第N层链接深处,就得N+1次调用才能挖出来,每次两三秒,链越深越慢。更麻烦的是,agent只能靠链接文字和标题判断值不值得点进去,这等于逼着写记忆的人做上世纪SEO式的标题优化,顺手记下的边角信息反而最容易被漏掉。

memoryfield的应对是语义检索直接跳到相关页面:一次搜索、一次并行读取,最多两次工具调用就能拿到全部相关记忆,不用管标题写得漂不漂亮。

工具调用次数:图谱越深,越慢 图谱 1层 2次 图谱 3层 4次 图谱 5层 6次 memoryfield 2次(恒定) memoryfield最多两次调用:一次搜索,一次并行读取,不随深度增加

规范现在挂在GitHub上,版本号v0.1,还是草案。里面的硬规矩比博客文章讲得更细:页面目录必须是扁平结构,不能建子目录;文件名只能是小写字母数字加连字符;单页软上限8192字节,超出的部分在生成向量时可能被直接截断。嵌入的对象是整份Markdown文件(含frontmatter),不是切碎的文本块。规模大了,可以从暴力全表扫描换成sqlite-vec的近似检索。还有个细节挺见心思:首页index.md被特意设计成不能塞完整目录,免得agent一读首页就把所有页面标题都吞进上下文——全量清单要单独放进listing.md。

简单的代价,是没人告诉你记忆什么时候该更新

memoryfield整套设计里,几乎看不到一个词:时效性。旧事实和后来更正的事实,在向量空间里是平等的两条记录,谁都不比谁更"新"。这恰好是图谱派和LangGraph这类主流agent框架长期在意的问题——LangGraph把单次会话的短期状态和跨会话的长期存储分开处理,长期存储里支持结构化字段,而不是不分青红皂白地把一切都塞进向量。Reddit上关于agent记忆的讨论里有个说法很扎心:如果新旧事实以同样的可检索性共存,模型很可能"自信地"选中或混合错误版本——这不是检索失灵,是检索太公平了。

  • 风险.memoryfield没有任何机制处理矛盾记忆或实体消解,一个客户名字换了三种叫法,agent未必知道它们指向同一个人。

反方还有一层论据:agent需要跨时间追踪状态、关系和多步上下文时,结构化图谱确实有优势。这跟Paterson批评的"图谱爬得慢"不是同一个问题——一个说的是检索效率,一个说的是记忆的正确性。两派吵的常常不是同一件事,却总被摆在同一个擂台上。


这更像一场关于模型能力曲线的赌注

memoryfield现在没有任何公开的采用证据:没有基准测试,没有主流agent框架接入,Reddit和Hacker News上也找不到几条正经讨论。跟它撞名的还有个PyPI包"memoryfields",是另一家公司完全不相关的Python客户端,容易被搜索误认成同一件事。说到底,这仍是一篇个人博客提案加一份刚起草的规范,离"行业标准"还有很长的路。

但这不妨碍它把问题问对了。

两种记忆赌注 简约派 · memoryfield 假设 模型会越来越会 自己纠错、消歧 代价 没有时效性机制 新旧事实平权 结构派 · 图谱/字段 假设 没有外部结构 agent会稳定记错 代价 遍历慢、维护重 实体消解常出错

Paterson赌的是:模型会越来越擅长自己处理歧义、自己纠错,不需要外部结构提前替它想好。图谱派赌的是:没有显式的时效性和矛盾覆盖机制,agent就会稳定地记错。

简单是一种赌注,不是一种美德。

这场赌局现在还没到期。真正该盯的不是memoryfield能不能火,是接下来有没有人拿naive-RAG、图记忆和memoryfield做一次正经的对照测试——没有基准数据之前,谁的直觉更对,谁也说不清。