Google Cloud 已开源 “Always-On Memory Agent,” 这一参考实现提出了一种为 AI 代理赋予记忆的不同方式——它抛开了目前业内大多依赖的向量数据库和 embeddings。该项目于 7月18日 上线,基于 Google 的 Agent Development KitGemini 3.1 Flash-Lite 构建。

The idea

与一次性调用不同,这个代理以 24/7 进程 方式运行。语言模型持续 读取、思考并写入结构化记忆 到一个普通的 SQLite 文件中——把记忆视为需要随时间维护的东西,就像人整理一天的经历,而不是按需检索。

No vector database

最醒目的缺失是检索栈。这里没有向量数据库,也没有 embeddings;LLM 本身决定什么重要,并将其记录为结构化文本。这用模型对已读材料的判断,换掉了相似度搜索的速度——对检索增强生成(RAG)正统做法的直接挑战。

How the agents divide the work

一个编排器将工作分派给三个子代理:IngestAgent 负责提取摘要、实体、主题和重要性;ConsolidateAgent 每隔 30 分钟 综合不同记忆之间的关联;QueryAgent 则带着回溯至源头的引文回答问题。该系统可摄取 27 种文件类型,覆盖五类内容——文本、图像、音频、视频和文档。

Why Flash-Lite

选择 Gemini 3.1 Flash-Lite 是这一方案得以成立的关键押注。只有模型足够便宜、足够快,持续的后台认知才算得过账。随着轻量模型不断进步,Always-On 式的整合变得可负担——而 Google 也恰好出售这一类模型。需要强调的是,这是一种参考设计,而不是产品;Google 发布的是一种可供他人复制的模式,而这正是架构默认项发生转变的方式。如果这一方法流行起来,为一次性检索而构建的大量向量数据库和 embeddings 工具就会开始显得可有可无。