Todo equipo que construye un agente de IA termina chocando contra el mismo muro. El agente es brillante dentro de una conversación, pero la conversación termina y lo olvida todo. Entonces alguien dice "démosle memoria" y echa mano de la herramienta obvia: una base vectorial de chats anteriores, una base de datos de embeddings, un bloc de notas donde el modelo apunta cosas entre sesiones.
Eso funciona justo hasta que usted lo pone en un lugar donde las cosas importan. En un canal regulado (salud, farma, cualquier ámbito donde haya que probar qué se sabía y cuándo), el cuaderno es precisamente lo que le falla. Se desvía con el tiempo. Se contradice. Y cuando alguien pregunta "¿por qué el sistema actuó con base en eso?", usted se queda con un montón de notas escritas por el modelo y ninguna forma de reconstruir cómo llegó ahí.
Me topé con esto mientras diseñaba la siguiente fase de un agente que ya tengo funcionando.
El agente opera en un canal de clientes en vivo (la API de Claude conectada a nuestro ERP, por WhatsApp). Califica leads, cotiza desde el catálogo en vivo y genera pedidos, todo detrás de salvaguardas: una barrera de integridad de precios para que no pueda inventar una cifra, controles de confirmación, pausa automática en cuanto interviene un humano y un único registro de solo adición (append-only) donde cada acción queda como un evento. Ese registro es lo que vuelve auditable todo el sistema. Se puede reproducir exactamente qué hizo y cuándo.
Así que cuando empecé a trabajar en la memoria (el sistema debería recordar que un paciente completó su admisión en el checkout, o que llamó la semana pasada por el mismo problema), yo también estuve a punto de echar mano del cuaderno. Entonces lo vi claro.
El replanteamiento
La memoria bien hecha ya está construida. Es el registro que tengo hoy,
Imagine la memoria como la proyección de un registro de solo adición, en lugar de un lugar donde el modelo guarda notas. El estado actual de un paciente (lo que dijo en la admisión, lo que compró, su dirección verificada) se obtiene reproduciendo, en orden, los eventos que le ocurrieron, en vez de guardarse como un bloque de datos que usted almacena y modifica. Eso significa que en cualquier momento usted puede responder "¿cómo y cuándo llegó el sistema a saber esto?" señalando los eventos exactos.
Dígalo en voz alta y el problema difícil se disuelve. La auditabilidad deja de ser un agregado y pasa a ser una consecuencia natural del diseño. La memoria y la pista de auditoría resultan ser el mismo registro. Usted simplemente lo lee de dos maneras.
La única distinción que lo salva
Aquí hay que sostener una línea, o todo se pudre. Hay dos cosas distintas a las que se les llama memoria:
Hechos de registro (una fecha de nacimiento, una dirección, lo que alguien pidió, las respuestas que dio en la admisión). Estructurados, con fuente, con valor oficial.
Contexto de trabajo (la idea general, el resumen, "parece frustrado", "probablemente quiere el paquete"). Escrito por el modelo, útil, nunca con valor oficial.
La falla aparece cuando el resumen de un modelo asciende en silencio a la categoría de hecho y un agente actúa con base en él. La regla que lo evita: el modelo puede leer hechos libremente, pero solo puede proponer uno nuevo mediante una llamada a herramienta restringida (la misma barrera que le impide inventar un precio). Sus propios resúmenes quedan en un carril derivado y claramente etiquetado, siempre regenerables a partir del registro y nunca como fuente de verdad.

Compartir memoria entre agentes
Esto también corrige un problema que la gente suele resolver mal. Si usted opera un agente distinto para cada fase (admisión, checkout, seguimiento), le conviene que ninguno guarde su propia memoria privada, porque la memoria privada no se puede compartir ni auditar. Así que ninguno la guarda. La memoria vive en un servicio de contexto que pertenece al middleware. Un agente escribe un evento, otro lee la proyección, y nunca tocan directamente la memoria del otro. Es la misma disciplina que impide que el modelo y el ERP hablen directamente. Un solo punto de confianza.

La parte que ningún diagrama le entrega
Ahora, la parte honesta. Auditable y buena son dos cualidades distintas. El registro garantiza que usted puede probar lo que el sistema sabía. Que lo recordado valiera la pena recordarlo ya es otra cuestión. Una memoria perfectamente auditable que le pasa al agente de checkout cada evento de admisión de hace ocho meses es ruido con rastro documental, lejos de ser una funcionalidad.
Por eso la última capa es de criterio: qué conviene mostrar, qué tan rápido decae la relevancia, cuánto contexto le da usted a un agente determinado para una tarea determinada. La forma más limpia que he encontrado de pensarlo toma prestado el modo en que una computadora administra la memoria (caché, RAM, SSD, almacenamiento en frío), ordenado según lo reciente de la información. Esta visita se mantiene caliente, en contexto completo. Esta semana está tibia y aparece automáticamente. Este mes se convierte en un resumen a pedido. Este año es un perfil compacto que solo se reproduce completo por una razón deliberada (una disputa, una auditoría). A medida que la información se enfría, el sistema muestra menos y resume más. La relevancia decae. El registro, nunca.

Lo que hay que notar de esa jerarquía: es una política de lectura sobre un único registro inmutable, en vez de cuatro almacenes separados. La verdad nunca cambia de lugar. Se muestra de forma distinta según qué tan relevante siga siendo.
En qué punto está esto
Para ser claro: el agente está en producción, y esta arquitectura de memoria es el diseño de su siguiente fase. La pongo por escrito porque el diseño es la parte difícil, y porque el principio aplica mucho más allá de mi propio caso de uso.
Si se lleva una sola idea de este artículo, que sea la que repito una y otra vez: consultar un recuerdo es una llamada a herramienta, guardar un recuerdo es un evento, y la memoria es una proyección del registro, nunca un cuaderno. Si acierta en eso, puede darle a una IA una memoria que un regulador podría leer sin pestañear.
Si usted está lidiando con lo mismo (una IA que necesita recordar, en un entorno donde hay que probar lo que sabía), siempre me interesa intercambiar experiencias.