¿El asistente de IA realmente tiene memoria o finge tenerla? HaluMem desenmascara la ilusión de la memoria artificial

Academia Inteligencia Artificial CIBERED

Un nuevo sistema de evaluación revela que los errores de memoria de los agentes inteligentes NO siempre ocurren al responder. Nacen del guardar, al actualizar o al recuperar la información; y eso lo cambia todo.


Imagina que le cuentas a tu asistente de IA que te han ascendido y días después, le preguntas por tu nuevo cargo y te responde con el antiguo. Lo fácil es pensar: “otra vez el modelo está alucinando”.

Pero ¿Y si el error no estuviera en la respuesta?, ¿Y si el asistente nunca guardó bien la memoria o la actualizó mal, o recuperó un recuerdo obsoleto?

Esa es la pregunta que ha llevado a un equipo de investigadores del Instituto de Investigación de China Telecom y Shanghai Memory Tensor Co., Ltd. entre otros, a crear HaluMem: el primer sistema de evaluación de alucinaciones a nivel operativo para sistemas de memoria de agentes inteligentes.

El trabajo ha sido aceptado en EMNLP 2026, una de las conferencias más importantes en procesamiento del lenguaje natural. La idea es sencilla pero poderosa: si queremos saber si una IA recuerda de forma fiable, no basta con mirar la respuesta final. Hay que abrir la caja negra y examinar cada paso del proceso de memoria.

El problema: una respuesta incorrecta puede nacer en cualquier fase

Los sistemas de memoria permiten que una IA conserve información del usuario a lo largo de conversaciones: a qué se dedica, qué le gusta, qué cambios ha vivido. Pero para que un dato pase del historial de chat a una respuesta final, debe recuperarse, almacenarse, actualizarse y buscarse.

Las evaluaciones tradicionales plantean preguntas y comparan la respuesta con una referencia. Eso mide el resultado, pero no explica por qué falló. HaluMem va más allá: proporciona respuestas estándar verificables también para las operaciones intermedias.

Por ejemplo, si un usuario dice: “Últimamente me gustan los loros, pero antes no me gustaban”, y el sistema interpreta “Al usuario no le gustan los loros”, el error se produce al guardar. Si el usuario afirma que su salud ha empeorado y el sistema actualiza a “bueno”, el fallo está en la actualización. Y si el asistente inventa un detalle no confirmado por el usuario, el sistema puede almacenarlo como un hecho y arrastrarlo a respuestas futuras.

Por eso HaluMem verifica tres aspectos por separado:

  • Recuperación de memoria: ¿se registró la información completa y precisa? ¿se colaron detalles ficticios?
  • Actualización de memoria: ¿se corrigieron los recuerdos antiguos cuando llegó información nueva? ¿hubo omisiones, errores o conflictos?
  • Preguntas y respuestas basadas en memoria: ¿puede el sistema usar lo que recuerda para responder correctamente? ¿cuántas respuestas son erróneas y cuántas quedan sin responder por falta de información?

Estas comprobaciones se hacen cronológicamente, justo después de cada sesión de diálogo. Así, la evaluación no da solo una puntuación global: muestra dónde se rompió la memoria.


Darle a la IA una “vida” de más de una década

Para detectar errores de memoria, primero hay que saber qué debería recordar el sistema en cada momento. Los chats reales rara vez tienen anotaciones tan completas. Por eso HaluMem diseñó un proceso de construcción de datos en seis etapas que simula la vida de un usuario durante 10 a 20 años.

A partir de perfiles de usuario, se construye un marco de desarrollo vital, se expande a un flujo de eventos, se generan resúmenes de conversación y puntos de memoria, y finalmente se crean diálogos de varias rondas y preguntas de evaluación. Los cambios de carrera, salud, intereses y relaciones evolucionan con el tiempo, formando tres tipos de recuerdos: perfiles, eventos y relaciones.

El resultado son dos versiones:

  • HaluMem-Medium: 20 usuarios, 30.073 rondas de diálogo, unos 160.000 tokens por usuario, 14.948 notas y 3.467 preguntas y respuestas.
  • HaluMem-Long: la misma memoria efectiva, pero con diálogos irrelevantes insertados dentro y entre sesiones. El contexto se extiende a millones de tokens y alcanza 53.516 rondas de diálogo.

La clave es que la versión larga no añade más datos esenciales, sino más distracciones y ruido. Si un sistema falla en Long pero acierta en Medium, el problema no es que no pueda recordar, sino que no sabe filtrar lo importante en un entorno abarrotado.


Seis sistemas bajo la lupa: tres hallazgos incómodos

El estudio evaluó seis sistemas de memoria: Mem0, Mem0-Graph, Memobase, MemOS, Supermemory y Zep, en dos escalas de contexto. Estos son los resultados principales.

1. Anotar más información no significa recordar mejor

En Medium, las tasas de recuperación de Mem0 y Mem0-Graph fueron del 42,91% y 43,28%. Memobase apenas alcanzó el 14,55%. En Long, esos tres sistemas cayeron a 3,23%, 2,24% y 6,18%. Es decir, añadir diálogos irrelevantes bastó para que algunos sistemas omitieran la gran mayoría de la información objetivo.

En el otro extremo, MemOS logró una recuperación del 81,90% en Long y Supermemory del 53,02%. Pero cubrir más memoria también trae un riesgo: introducir interferencias. HaluMem mide la Resistencia a la Falsa Memoria (FMR), la capacidad de ignorar recuerdos distractores mencionados por el asistente pero no confirmados por el usuario. En Long, MemOS y Supermemory obtuvieron FMR de 28,85% y 36,86%. Ampliar la cobertura no garantiza distinguir lo verdadero de lo falso.

Una memoria fiable necesita dos cosas a la vez: no olvidar lo que debe recordar y no almacenar lo que no debe creer.

2. La tasa de actualización errónea es baja, pero las omisiones son enormes

Si solo se mira la tasa de ilusión de actualización, los resultados parecen buenos: en el experimento principal fue inferior al 1,2% para todos los sistemas. Pero al observar la tasa de omisión, el panorama cambia.

En Long, cinco de los seis sistemas tuvieron tasas de omisión de actualizaciones superiores al 60%. Mem0 y Mem0-Graph alcanzaron 98,51% y 98,40% de omisión, con tasas de actualización correcta de solo 1,45% y 1,47%. MemOS logró la mejor tasa de actualización correcta, 65,25%, pero aun así omitió un tercio de las actualizaciones previstas.

¿Cómo se explica que se corrijan pocos errores y a la vez se omitan tantas correcciones? Porque si apenas se actualiza nada, la proporción de actualizaciones fallidas puede ser baja. Además, las actualizaciones dependen de recuperaciones previas: si los datos antiguos nunca se guardaron, no hay nada que actualizar después.

3. Los problemas de memoria acaban saliendo en las respuestas

En el sistema unificado de preguntas y respuestas, ningún sistema superó el 70% de precisión. MemOS obtuvo los mejores valores: 67,23% en Medium y 64,44% en Long. Mem0, en cambio, cayó del 53,02% al 28,11% al pasar a contextos largos, mientras su tasa de omisión de respuestas subió del 27,81% al 54,60%.

Los tipos de pregunta también revelan diferencias: la mayoría de los sistemas identifican bien información desconocida o premisas incorrectas, pero fallan en razonamientos de múltiples saltos, actualizaciones dinámicas y generalización.


¿Qué diferencia hay entre “poder recordar” y “recordar de forma fiable”?

HaluMem no se limita a decir que los sistemas de memoria fallan. Su valor está en señalar dónde mejorar.

Si el problema está en la recuperación, hay que revisar la cobertura y la credibilidad de la fuente. Si está en la actualización, hay que comprobar la conexión entre recuerdos antiguos y nuevos. Si está en las respuestas, hay que analizar los registros previos y los resultados de búsqueda.

Una sola métrica impresionante no basta: una alta recuperación puede venir con información falsa; una baja tasa de ilusión de actualización puede esconder muchísimas omisiones; y una buena puntuación final puede enmascarar fallos en etapas internas.

Los investigadores validaron manualmente 700 conversaciones de Medium, más de la mitad del total, con una precisión del 95,70%. También repitieron la evaluación con GPT-5.4-mini en lugar de GPT-4o y los hallazgos principales se mantuvieron.

El trabajo tiene límites: los datos se centran en perfiles, eventos y relaciones, pero aún no cubren del todo otras formas de memoria, como herramientas y habilidades. Aunque ofrece un método reutilizable: analizar una a una las operaciones que hay detrás de cada respuesta.


La próxima vez que tu IA se equivoque, pregunta más

Volvamos al asistente que dio el puesto incorrecto. En lugar de preguntar “¿Por qué te equivocaste otra vez?”, ahora podemos indagar: ¿Se registró bien esta información al principio?, ¿Se corrigió después del escalado?, ¿Qué recuerdo se usó al responder?

Solo cuando estas preguntas puedan responderse una por una, la IA tendrá un camino claro hacia una memoria a largo plazo verdaderamente fiable y quizá entonces, dejemos de confundir una alucinación con un simple fallo de memoria.

Vistas: 1

Descubre más desde CIBERED

Suscríbete y recibe las últimas entradas en tu correo electrónico.

Scroll al inicio