Google Cloud ha liberado como código abierto un "Always-On Memory Agent," una implementación de referencia que propone una forma distinta de dotar de memoria a los agentes de IA: una que prescinde de la base de datos vectorial y de los embeddings de los que depende actualmente gran parte del sector. Llegó el 18 de julio y está construido sobre el Agent Development Kit de Google y Gemini 3.1 Flash-Lite.
La idea
En lugar de ejecutar llamadas puntuales, el agente funciona 24/7 como un proceso. Un modelo de lenguaje lee, razona y escribe de forma continua memoria estructurada en un archivo SQLite sencillo, tratando la memoria como algo que se mantiene a lo largo del tiempo, del mismo modo que una persona consolida los acontecimientos del día, en lugar de recuperarla bajo demanda.
Sin base de datos vectorial
La omisión más llamativa es la capa de recuperación. No hay base de datos vectorial ni embeddings; el propio LLM decide qué es importante y lo registra como texto estructurado. Eso intercambia la velocidad de la búsqueda por similitud por el criterio de un modelo que realmente ha leído el material: un desafío directo a la ortodoxia de la generación aumentada por recuperación.
Cómo se reparten el trabajo los agentes
Un orquestador distribuye el trabajo entre tres subagentes: IngestAgent extrae resúmenes, entidades, temas e importancia; ConsolidateAgent sintetiza vínculos entre memorias cada 30 minutos; y QueryAgent responde preguntas con citas a la fuente. El sistema ingiere 27 tipos de archivo en cinco categorías: texto, imágenes, audio, vídeo y documentos.
Por qué Flash-Lite
La elección de Gemini 3.1 Flash-Lite es la apuesta que lo hace posible. La cognición continua en segundo plano solo sale a cuenta si el modelo es lo bastante barato y rápido como para funcionar todo el tiempo. A medida que mejoran los modelos ligeros, la consolidación siempre activa se vuelve asequible, y Google, convenientemente, vende precisamente esa clase de modelo. Conviene subrayar que se trata de un diseño de referencia, no de un producto; Google publica un patrón que otros pueden copiar, y precisamente así cambian los valores predeterminados de la arquitectura. Si el enfoque prende, una amplia gama de herramientas de bases de datos vectoriales y embeddings creadas para la recuperación puntual empezará a parecer opcional.
