
Paper · Serie Más allá del agente · P05
Memoria que actúa
Un protocolo de atribución causal para distinguir traza, archivo, retrieval, memoria, aprendizaje, estigmergia y contaminación en agentes y ensamblajes humano–IA.
Archivo, recuperación y memoria causal en agentes y ensamblajes humano–IA
Autor: Agustín Hipólito Tomás
Edición pública: 1.0 · 10 de septiembre de 2026
Base científica: manuscrito v0.2
Serie: Más allá del agente · P05
Estatuto: hipótesis de trabajo · protocolo de atribución causal · programa experimental
Corte bibliográfico: 10 de septiembre de 2026
Resumen
Los agentes de lenguaje actuales incorporan historiales, bases vectoriales, grafos, perfiles, resúmenes, diarios, runbooks, contextos virtuales y sistemas jerárquicos de memoria. Esta proliferación ha normalizado una frase engañosamente simple: «el agente recuerda». Sin embargo, una respuesta correcta sobre el pasado puede proceder de los pesos del modelo, del contexto inmediato, de un documento recuperado, de una memoria externa legítima, de una caché accidental o de contaminación experimental. Persistir no equivale a estar accesible; recuperar no equivale a usar; usar información contextual no equivale a aprender; y una capacidad de memoria del agente no debe localizarse automáticamente en el modelo base.
Este paper propone un protocolo para distinguir traza, archivo, accesibilidad, retrieval, influencia contextual, memoria episódica, memoria consolidada, aprendizaje, memoria estigmérgica y contaminación. La unidad de atribución se declara antes de la propiedad: modelo/checkpoint, instancia, agente situado o ensamblaje humano–IA. Una atribución fuerte de memoria exige un lineage verificable: en memoria episódica (ME), provenance hacia episodios concretos; en memoria consolidada (MC), una cadena auditable de transformación desde experiencia hacia regla, resumen, política o representación. Además, una intervención o ablación sobre el soporte relevante debe modificar selectivamente operaciones posteriores bajo controles que excluyan conocimiento paramétrico, recencia, similitud léxica, cambios de longitud/posición e interferencia entre condiciones.
La contribución no es una nueva arquitectura de memoria. Surveys y sistemas recientes ya cubren ciclos de escritura–gestión–lectura, memoria episódica, jerarquías, reflexión, lifelong learning, retrieval y consolidación. La contribución candidata es una disciplina de atribución causal y localización basada en unidad, lineage/provenance, intervención, selectividad, actualización y controles de contaminación.
La tesis final es estrecha: una memoria actúa cuando una diferencia producida por el pasado modifica de forma contrafácticamente demostrable lo que una unidad puede hacer después; el lugar donde esa diferencia persiste forma parte del resultado científico.
Abstract
Modern language agents incorporate histories, vector stores, graphs, user profiles, summaries, journals, runbooks, virtual context, and hierarchical memory systems. This architectural proliferation has normalized a deceptively simple statement: “the agent remembers.” Yet a correct answer about the past may come from model weights, the current context, an externally retrieved document, a legitimate episodic store, an accidental cache, or experimental contamination. Persistence is not accessibility; retrieval is not use; contextual influence is not learning; and memory attributed to an agent should not automatically be localized in the base model.
We propose a protocol distinguishing trace, archive, accessibility, retrieval, contextual influence, episodic memory, consolidated memory, learning, stigmergic memory, and contamination. Strong memory attribution requires a verifiable lineage and a selective causal effect on later operations. The contribution is not a new memory architecture, but a causal attribution and localization discipline.
The conclusion is narrow: memory acts when a difference produced by the past makes a counterfactually demonstrable difference to what a declared unit does next; where that difference persists is part of the scientific result.
1. Una palabra demasiado cómoda
En sistemas artificiales usamos «memoria» para operaciones heterogéneas: mantener texto en una ventana, guardar mensajes, recuperar embeddings similares, conservar checkpoints, sintetizar trayectorias, escribir reglas o reinyectar resúmenes.
Todas pueden ser útiles. No todas justifican la misma atribución.
Un archivo contiene el pasado aunque nadie vuelva a leerlo. Un vector store recupera información aunque esa información nunca altere una decisión. Un LLM puede acertar un dato porque ya estaba en entrenamiento. Una conversación puede parecer continua porque una plataforma reinyecta un resumen. Y una organización puede conservar una corrección durante años en un procedimiento que ninguna persona recuerda por sí sola.
La pregunta de P05 no es si esas arquitecturas existen. Es esta:
¿cuándo una huella del pasado forma parte causalmente de la continuidad de una unidad y merece llamarse memoria de esa unidad?
2. El espacio científico ya ocupado
La investigación reciente ya trata la memoria como módulo central de agentes autónomos. Surveys de 2025–2026 organizan el campo mediante ciclos de escritura, gestión y lectura y distinguen sustratos, horizontes temporales y políticas de control. MemoryOS, MemInsight, CDMem, RMM y THEANINE representan familias distintas de memoria jerárquica, contextual, temporal y reflexiva.
Los benchmarks también han avanzado. LoCoMo evalúa conversaciones muy largas y razonamiento temporal. LongMemEval separa extracción, razonamiento entre sesiones, actualización y abstención. LongMemEval-V2 desplaza el foco hacia experiencia de agente en entornos. LoCoMo-Plus añade un control especialmente importante: una memoria útil puede tener que aplicarse cuando la consulta posterior no repite las palabras del episodio original.
P05 no reclama prioridad sobre esos desarrollos. Su objeto es distinto: cuándo está justificado atribuir memoria a una unidad concreta y qué evidencia causal derrota rivales más simples.
3. Antes de la memoria está la unidad
P05 conserva cuatro unidades:
U1: modelo/checkpoint;U2: ejecución o sesión;U3: agente situado con memoria, herramientas y estado;U4: ensamblaje humano–IA con archivos, reglas, personas y superficies externas.
Un agente U3 puede poseer memoria funcional aunque U1 no haya actualizado pesos. Un proceso U4 puede recordar a través de documentos y manifiestos aunque cada nueva instancia de modelo empiece sin memoria episódica local.
La pregunta «¿el modelo recuerda?» debe sustituirse por:
¿qué unidad conserva qué diferencia del pasado, mediante qué sustrato y con qué efecto contrafáctico sobre la operación posterior?
4. Nueve operaciones que no deben fundirse
Traza. Registro persistente producido por un episodio.
Archivo. Sistema de conservación y localización potencial.
Accesibilidad. Posibilidad de que la unidad vuelva a recibir la traza.
Retrieval. Operación que selecciona y reintroduce información.
Influencia contextual. Cambio local de una salida provocado por esa información.
Memoria episódica (ME). Conservación con provenance hacia episodios concretos.
Memoria consolidada (MC). Conservación de una diferencia derivada de experiencia mediante una cadena auditable de transformación, aunque el episodio original haya sido comprimido.
Aprendizaje. Cambio relativamente estable de política, representación o capacidad.
Memoria estigmérgica. Huella ambiental que condiciona operaciones futuras.
A estas nueve operaciones se añade un rival transversal: contaminación, es decir, cualquier vía no declarada por la que información del pasado aparezca en la prueba.
5. Criterio causal de atribución
Para una unidad U, una experiencia pasada y una decisión futura Y, una atribución fuerte de memoria exige:
Lineage temporal. Para ME, provenance hacia un episodio. Para MC, una cadena auditable de transformación desde experiencia hacia regla, resumen, embedding, política o representación.
Persistencia. La diferencia sobrevive fuera del instante productor.
Accesibilidad. La unidad dispone de una ruta para volver a usarla.
Dependencia causal. Retirar o intervenir la memoria cambia la conducta pertinente bajo condiciones emparejadas.
Selectividad. El efecto aparece donde la experiencia importa y no de forma indiscriminada.
Actualizabilidad. Si el mundo cambia, la memoria puede corregirse, invalidarse o conservarse con marca temporal.
Resistencia a rivales. El resultado no colapsa al controlar conocimiento paramétrico, recencia, posición, similitud superficial y contaminación.
Un contraste mínimo es:
ΔM = E[Y | do(m = presente)] − E[Y | do(m = ausente)].
Toda ablación debe incluir, cuando sea posible, un placebo de longitud y posición equivalentes para separar contenido de cambios en attention budget, recencia o competencia contextual.
6. Documento no es recuerdo
Imaginemos dos sistemas que reciben exactamente la misma página antes de responder. En A, la página es un manual externo. En B, es una nota creada por el propio proceso después de un fallo anterior y guardada para evitar su repetición.
El contenido puede ser idéntico. La causalidad inmediata también. La genealogía episódica solo añade una diferencia operacional si provenance o historia son utilizadas funcionalmente. Por eso comparar «memoria» con «documento equivalente» no demuestra memoria por sí solo: sirve para localizar si la procedencia temporal desempeña un papel.
7. Memoria no equivale a aprendizaje
Un agente puede recordar un hecho episódico y utilizarlo una vez sin modificar una política general. Otro puede extraer una regla de varios errores y aplicarla a tareas nuevas. Un tercero puede modificar pesos y cambiar su conducta sin conservar acceso a los episodios originales.
Memoria y aprendizaje son dimensiones cruzadas, no sinónimos.
8. Memoria obsoleta
Recordar más no siempre es mejor. Una política antigua, una preferencia caducada o un permiso que ya no existe pueden fallar precisamente por su persistencia.
Una memoria madura debe distinguir:
era cierto
es cierto ahora
fue sustituido por
no sé cuál es el estado actual.
Actualizar sin borrar genealogía forma parte de la calidad de la memoria.
9. Romper la similitud léxica
Si la consulta posterior repite las mismas palabras que el episodio almacenado, un vector store puede resolver la tarea mediante similitud superficial. P05 adopta el principio de cue–trigger semantic disconnect: una experiencia contiene una regla o restricción y una tarea posterior debe respetarla sin recibir la pista lexical original.
10. Estigmergia: recordar fuera de la cabeza
Un agente puede modificar un archivo, una pizarra, un repositorio o un estado compartido. Otro actúa después de acuerdo con esa huella. La memoria puede residir en el circuito agente–entorno.
Eso no implica sujeto colectivo. Significa que la unidad funcional correcta puede ser mayor que un componente aislado.
11. Contaminación como rival obligatorio
Training leakage. La información ya estaba en los pesos.
Shared state. Control y tratamiento comparten caché, workspace o memoria.
Retrieval leakage. El retriever accede a materiales fuera del corpus declarado.
Prompt leakage. La instrucción revela qué debía recordarse.
Evaluator leakage. La relevancia de las trazas se decide retrospectivamente a partir del éxito.
Un experimento de memoria que no documente contaminación no puede distinguir continuidad de filtración.
12. Protocolo de atribución
Toda afirmación de memoria debe registrar:
| Campo | Pregunta |
|---|---|
| Unidad | ¿U1, U2, U3 o U4? |
| Episodio/experiencia | ¿Qué ocurrió y cuándo? |
| Traza o consolidación | ¿Qué persistió exactamente? |
| Sustrato | ¿Pesos, contexto, DB, grafo, archivo, entorno? |
| Escritura/consolidación | ¿Quién o qué decidió conservar o abstraer? |
| Acceso | ¿Cómo vuelve al circuito? |
| Uso | ¿Qué operación futura depende de ello? |
| Contrafáctico | ¿Qué cambia al retirar/intervenir el soporte? |
| Actualización | ¿Qué sucede si queda obsoleta? |
| Rivales | ¿Conocimiento paramétrico, retrieval, recencia o contaminación? |
El protocolo puede devolver: memoria funcional apoyada, persistencia/retrieval sin atribución causal suficiente, o atribución no localizable/contaminada.
13. Programa experimental
Estudio A · M+ / M− / D / C
Un episodio produce información necesaria después.
M+: memoria legítima disponible;M−: misma arquitectura, memoria retirada;D: distractor similar pero incorrecto;C: contenido correcto como documento externo sin historia episódica.
M+ vs M− mide dependencia. D mide robustez ante falsa familiaridad. M+ vs C solo pregunta si provenance o historia se usan funcionalmente. Deben añadirse placebos matched-token y matched-position.
Estudio B · Cambio temporal
Se registra m1. El mundo cambia. Se registra m2 incompatible. La prueba exige elegir el estado actual, conservar correctamente la historia y abstenerse cuando no pueda determinarse cuál gobierna.
Estudio C · Transferencia sin palabras compartidas
La experiencia enseña una restricción, preferencia o gotcha. Una tarea nueva debe aplicarla sin repetir los términos originales.
Estudio D · Ablación de sustratos
Se retiran uno por uno contexto, vector store, archivo, profile, tools o memoria de pesos cuando sea posible. La caída selectiva localiza el soporte funcional.
Estudio E · Estigmergia
A deja una huella ambiental. B no recibe mensaje directo. La huella altera su conducta. Se compara contra entorno limpio, huella aleatoria y mensaje explícito equivalente.
14. Endpoints y falsación
Endpoints primarios:
- efecto de ablación en tareas memory-dependent;
- efecto nulo esperado en tareas memory-independent;
- actualización correcta ante contradicción temporal;
- transferencia bajo cue–trigger disconnect.
P05 gana fuerza si esos efectos son selectivos, reproducibles y sobreviven a controles de contaminación. Se debilita si retrieval + contexto + provenance explican todo sin que el criterio causal fuerce decisiones nuevas; si las pruebas dependen de palabras compartidas; si los efectos desaparecen al aislar el estado; o si no puede localizarse qué sustrato sostiene la continuidad.
15. Relación con P01–P04
P01 impide transferir memoria hacia sujeto o responsabilidad. P02 recuerda que una memoria distribuida puede ser propiedad de una dinámica colectiva sin constituir un macro-agente. P03 trata memoria como parte de la arquitectura contextual. P04 utiliza persistencia/reinscripción en el análisis de reflexividad.
P05 ocupa otra frontera:
P03 = qué contexto opera
P04 = qué representación propia cambia la operación
P05 = qué pasado persiste causalmente y dónde.
16. Caso humano–IA
Un proyecto humano–IA puede conservar años de trabajo mediante documentos, repositorios, índices, prompts, manifiestos y decisiones humanas. Una instancia nueva puede reconstruir parte de esa continuidad.
Sería incorrecto decir que «el modelo recuerda años de relación» si el checkpoint no posee esa historia. También sería incorrecto decir que no existe memoria funcional alguna. La memoria puede estar realizada por el ensamblaje.
La pregunta práctica pasa a ser:
¿qué tendría que retirar o alterar para que esta corrección dejara de influir mañana, y qué lineage demuestra que esa corrección procede de la historia del sistema?
17. Implicaciones para ingeniería y gobernanza
Una memoria falsa puede estabilizar errores. Una memoria obsoleta puede preservar permisos inexistentes. Una memoria sin provenance puede mezclar instrucciones y hechos. Una memoria demasiado agresiva puede convertir una preferencia puntual en identidad permanente. Un sistema multiagente puede contaminarse mediante trazas compartidas que ningún componente controla.
Una memoria gobernable debería permitir inspeccionar fuente y fecha, distinguir observación de inferencia y regla, invalidar sin borrar historia, aislar ámbitos, registrar quién escribió o consolidó y probar contrafácticamente qué depende de cada memoria.
La memoria no es solo almacenamiento. Es una superficie de control.
18. Limitaciones
«Memoria funcional» no es aquí una nueva categoría psicológica ni neurocientífica. Es una atribución operacional para sistemas artificiales. Una intervención puede cambiar longitud y posición del contexto, por lo que hacen falta placebos. La independencia entre memoria episódica y conocimiento paramétrico es difícil en sistemas propietarios. Una memoria externa puede ser causal sin ser explícitamente representada por el modelo, en cuyo caso la atribución corresponde a una unidad mayor. Y demostrar que el pasado causa una decisión no demuestra experiencia de recordar.
19. Conclusión
Un archivo puede persistir y no actuar. Un retriever puede actuar sin recuperar historia propia. Un modelo puede saber sin recordar. Un agente puede recordar sin cambiar pesos. Un ensamblaje puede conservar una corrección aunque cada componente sea sustituible.
La pregunta científicamente útil es contrafáctica y localizada:
¿qué diferencia del pasado sigue presente, dónde está inscrita y qué operación futura dejaría de ocurrir si la retiramos?
P05 no reclama una nueva entidad denominada «memoria causal». Propone un criterio causal de atribución de memoria: una relación demostrada entre experiencia pasada, lineage/provenance, un soporte persistente y una modificación selectiva de conducta posterior en una unidad declarada.
La regla que deja a la serie es:
traza ≠ memoria
archivo ≠ acceso
retrieval ≠ recuerdo
influencia contextual ≠ aprendizaje
memoria del agente ≠ memoria del checkpoint
persistencia distribuida ≠ sujeto distribuido.
La memoria actúa cuando una diferencia trazable del pasado cambia el futuro y ese efecto sobrevive a controles capaces de excluir una simple coincidencia contextual.
Bibliografía nuclear
- Du, P. (2026). Memory for Autonomous LLM Agents: Mechanisms, Evaluation, and Emerging Frontiers. arXiv:2603.07670.
- Luo, J., Tian, Y., Cao, C., et al. (2026). From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms. arXiv:2605.06716.
- Zheng, J., Shi, C., Cai, X., et al. (2025). Lifelong Learning of Large Language Model based Agents: A Roadmap. arXiv:2501.07278.
- Maharana, A., Lee, D.-H., Tulyakov, S., Bansal, M., Barbieri, F., & Fang, Y. (2024). Evaluating Very Long-Term Conversational Memory of LLM Agents. ACL 2024. https://doi.org/10.18653/v1/2024.acl-long.747
- Wu, D., Wang, H., Yu, W., Zhang, Y., Chang, K.-W., & Yu, D. (2024). LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory. arXiv:2410.10813.
- Wu, D., Ji, Z., Kawatkar, A., et al. (2026). LongMemEval-V2: Evaluating Long-Term Agent Memory Toward Experienced Colleagues. arXiv:2605.12493.
- Li, Y., Guo, W., Zhang, L., et al. (2026). Locomo-Plus: Beyond-Factual Cognitive Memory Evaluation Framework for LLM Agents. ACL 2026. https://doi.org/10.18653/v1/2026.acl-long.1150
- Kang, J., Ji, M., Zhao, Z., & Bai, T. (2025). Memory OS of AI Agent. EMNLP 2025. https://doi.org/10.18653/v1/2025.emnlp-main.1318
- Salama, R., Cai, J., Yuan, M., et al. (2025). MemInsight: Autonomous Memory Augmentation for LLM Agents. EMNLP 2025. https://doi.org/10.18653/v1/2025.emnlp-main.1683
- Gao, P., Zhao, J., Chen, X., & Yilin, L. (2025). An Efficient Context-Dependent Memory Framework for LLM-Centric Agents. NAACL 2025. https://doi.org/10.18653/v1/2025.naacl-industry.80
- Ong, K. T.-i., Kim, N., Gwak, M., et al. (2025). Towards Lifelong Dialogue Agents via Timeline-based Memory Management. NAACL 2025. https://doi.org/10.18653/v1/2025.naacl-long.435
- Shilov, I., Meeus, M., & de Montjoye, Y.-A. (2026). The mosaic memory of large language models. Nature Communications, 17, 2142.
Sobre esta publicación
- Autor
- Hipólito