MemoryLake
Volver a todos los artículos
News6 de agosto de 2026·12 min de lectura

Por qué los asistentes de IA inventan datos sobre ti y cómo solucionarlo (2026)

Le dijiste a tu asistente que vives en Berlín y trabajas en logística. Tres semanas después, te escribe un párrafo que describe tu "familia joven", tus "carreras matutinas junto al canal" y tu preferencia por una "comunicación directa y sin rodeos". Nunca dijiste nada de eso. No se olvidó de ti: rellenó los huecos.

Aquí está la respuesta directa: los asistentes con memoria persistente almacenan una pequeña cantidad de cosas que realmente dijiste y luego generan contenido a partir de ese registro. Lo que el registro no cubre se complementa mediante inferencias, y las inferencias no se marcan como tales. Un nuevo artículo de investigación midió exactamente esto y descubrió que todos los modelos probados lo hacen, a tasas de entre un tercio y la mitad de las afirmaciones que hacen sobre un usuario. La solución no es un mejor modelo o un prompt más estricto. Consiste en mantener el registro de lo que realmente dijiste en un lugar que puedas leer, corregir y señalar, de modo que las partes que provienen de ti se puedan separar de las partes que el modelo imaginó.

Este artículo analiza qué midió la investigación, por qué este comportamiento es estructural y no un error, qué solucionan y qué no las soluciones habituales, y cómo configurar una capa de memoria cuyos contenidos realmente puedas auditar.

Qué midió realmente la nueva investigación

El 5 de agosto de 2026, Yushi Sun, Yanjie Zhang y Rui Sheng publicaron en arXiv un artículo preliminar titulado The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads. Comienza con la premisa clave: los asistentes personalizados con memoria persistente se están implementando de forma masiva, y nadie ha estado comprobando si los modelos de usuario en su interior son fieles a la evidencia.

Los autores crearon un banco de pruebas llamado MirageBench: 150 perfiles equilibrados entre estereotipados, contraestereotipados y neutros, evaluados a través de seis tareas de personalización organizadas a lo largo de lo que llaman un "gradiente de imaginación": escribir una biografía para un perfil de citas, recomendar un itinerario de fin de semana en una ciudad desconocida, redactar una carta de recomendación, elegir un regalo de cumpleaños de $100, describir el apartamento del usuario e identificar qué es lo que más estresa al usuario. Cada afirmación que el modelo hacía sobre el usuario se clasificó en cuatro categorías: Grounded (basada en evidencias, repite lo que dijo el usuario), Reasonable (razonable, amplía la evidencia en un paso de sentido común), Stereotype (estereotipo, sustituye la evidencia individual por sesgos demográficos o profesionales) y Fabricated (inventada, sin ninguna base empírica).

La cifra principal: en 12 modelos de 7 familias y 143,616 afirmaciones evaluadas, cada uno de los modelos sobreinfirió entre el 35% y el 49% de sus afirmaciones, con una media entre modelos del 41.6%. Ni un solo modelo de la evaluación se libró de ello. La tasa varía según la tarea (del 27% al 59%), lo que demuestra que este comportamiento se ve provocado por el margen que la tarea deja a la imaginación.

Vale la pena destacar dos detalles. En primer lugar, en un piloto de varios turnos, los atributos inferidos se acumularon de forma aproximadamente lineal con muy pocas correcciones: una vez que el modelo decidía algo sobre ti, los turnos posteriores tendían a basarse en ello en lugar de verificarlo. En segundo lugar, los autores descubrieron lo que llaman una Inversión del Automonitoreo (Self-Monitoring Inversion): a la hora de elegir entre modelos, la sobreinferencia autoevaluada de un modelo tenía una correlación de rango negativa con la sobreinferencia medida por un juez independiente. Los modelos que afirmaban ser más cuidadosos tendían a ser los que el juez señalaba como los que más inventaban.

Tres advertencias honestas, ya que cambian el peso que se debe dar a esto:

  • Este es un artículo preliminar (preprint), no un trabajo revisado por pares. Se publicó el 5 de agosto de 2026, y las cifras siguientes deben leerse como una primera medición, no como un resultado definitivo.
  • La Inversión del Automonitoreo es explícitamente exploratoria. La correlación es rho = −0.60 con p = 0.044, pero los autores informan de un intervalo de confianza bootstrap de [−0.90, +0.06] con n = 12, lo suficientemente amplio como para incluir la ausencia de efecto. No es evidencia de que los modelos nunca puedan autoverificarse: dentro de un mismo modelo, la autoevaluación siguió clasificando moderadamente bien las propias afirmaciones del modelo (AUROC 0.58–0.83). El hallazgo es más acotado y útil que decir "la IA no sabe cuándo miente". Significa que la confianza autoinformada es una mala forma de comparar modelos.
  • Las tareas son de la vida personal, no laboral. MirageBench preguntó a los modelos sobre apartamentos y regalos de cumpleaños, no sobre tu proceso de despliegue o las condiciones de facturación de tu cliente. El mecanismo (llenar un vacío de evidencia con conocimientos previos) no cambia de forma obvia cuando el tema es el trabajo, pero el banco de pruebas no evaluó eso, por lo que tampoco deberías asumir que los porcentajes se trasladan directamente.

Los modelos evaluados fueron GPT-5.5, GPT-5.4-nano, GPT-4o-mini, Claude-Opus-4-6, Gemini-3.1-pro-preview, Gemini-3-flash-preview, DeepSeek-v4-pro, DeepSeek-v4-flash, Qwen3.6-plus, Qwen3-8B, GLM-5.1 y Kimi-K2.5. El propio juez fue validado frente a un anotador humano ciego en 400 afirmaciones, alcanzando un kappa de Cohen de 0.863 en la tarea de cuatro clases y de 0.900 en la binaria; una concordancia decente, pero que no deja de ser un juez basado en LLM.

Por qué los asistentes de IA inventan datos sobre ti

El vacío tiene que llenarse con algo

Una memoria integrada almacena una lista corta de datos. Siendo generosos, se trata de unos cientos de palabras sobre una persona: un puñado de preferencias, un puesto de trabajo, un par de proyectos en curso. Luego le pides algo que requiere una respuesta con forma humana: una biografía, una recomendación, un correo electrónico con un tono adaptado. El modelo tiene que producir un texto fluido y específico sobre alguien de quien solo conoce seis cosas.

No existe ningún mecanismo que haga que el 90% restante aparezca en blanco. Los modelos de lenguaje completan; no se abstienen por defecto. Así que el vacío se llena con lo que sea estadísticamente probable para alguien que mencionó Berlín y la logística. Este es el mismo comportamiento que los hace útiles para redactar borradores y peligrosos para llevar registros, y es la razón por la que los contextos grandes tampoco resuelven el problema: el problema no es cuánto cabe, sino que nada distingue lo que se proporcionó de lo que se generó.

Los estereotipos son más baratos que la evidencia

La elección de diseño más incisiva de MirageBench fue equilibrar los perfiles entre estereotipados y contraestereotipados. Esa separación es lo que permite ver el modo de fallo: cuando la evidencia individual es escasa, entran en juego los sesgos demográficos y profesionales. A una enfermera se la describe como atenta. A un analista cuantitativo se le describe como directo. Ninguno describió a la persona; ambos describieron la categoría.

En entornos laborales, esto se manifiesta como un asistente que asume que tu equipo funciona como la mayoría de los equipos: que usas la herramienta estándar, sigues el proceso estándar y quieres el entregable estándar. Es confiadamente genérico de una manera que parece personalizada.

Las inferencias se acumulan porque nada las corrige

El hallazgo sobre los múltiples turnos es el que debería preocupar a cualquiera que use un asistente durante meses. Los atributos inferidos se acumularon con muy pocas correcciones. Eso es lo que cabe esperar de un sistema cuya memoria registra los resultados en lugar de las fuentes: una inferencia de la primera semana se escribe en el mismo formato que algo que tú declaraste, y para la quinta semana es indistinguible de un hecho. Nada en el bucle vuelve atrás y pregunta "¿realmente dijeron esto alguna vez?"

Lo que la gente intenta

Corregirlo en el chat. Esto funciona para la conversación actual y es, sin duda, el primer paso correcto. Lo que no hace es eliminar la inferencia de la memoria, ni evita que la misma inferencia se vuelva a generar la semana siguiente a partir de la misma evidencia escasa.

Leer y depurar la lista de memoria. Es mejor y vale la pena hacerlo. Pero una lista de memoria guardada te muestra entradas, no la procedencia: ves "prefiere una comunicación directa y concisa" sin ver si lo dijiste tú o si el modelo llegó a esa conclusión. Terminas auditando una lista donde todo parece tener la misma autoridad.

Escribir un bloque largo de instrucciones personalizadas. Esto eleva el nivel mínimo: cuanto más declares explícitamente, menos tendrá que inventar el modelo. Es el paso manual con mayor impacto. Las limitaciones son que el bloque es pequeño, no crece contigo y se aplica a un solo producto; tienes que volver a indicar los mismos datos en cada una de las demás herramientas que utilices.

Pedirle al modelo que señale su propia incertidumbre. Esta es la solución alternativa que la investigación desacredita específicamente. Dentro de un mismo modelo, la autoevaluación aporta cierta señal, por lo que preguntar "¿cuál de estas cosas te dije realmente?" no es inútil. Sin embargo, la conclusión de los autores es inequívoca respecto a la tendencia: el autoinforme no es la base sobre la que construir la confianza.

Iniciar chats nuevos para evitar la acumulación. Es eficaz para detener la acumulación, pero resulta costoso: has cambiado un contexto inventado por la ausencia de contexto, que es precisamente el problema que la función de memoria debía resolver.

La solución: mantén un registro de lo que realmente dijiste

La propia recomendación del artículo es el principio de diseño: posiciona la verificación externa, en lugar del autoinforme del modelo, como la base más confiable para una personalización segura, y aboga por un seguimiento de la procedencia que separe los hechos declarados de las inferencias no respaldadas, tratando las inferencias no vinculadas como hipótesis en lugar de hechos establecidos.

Esa es la descripción de una capa de memoria que vive fuera del modelo. No un asistente más inteligente: un almacén de material de origen que te pertenece, del cual lee cualquier asistente y cuyos contenidos puedes inspeccionar línea por línea. Cuando el registro dice "proceso de revisión trimestral, del documento que subí el 3 de marzo", el modelo tiene algo en lo que basarse. Cuando el registro no dice nada, al menos sabes que la especificidad del resultado provino de otra parte.

Para ser claros sobre lo que esto te aporta y lo que no: una capa de memoria externa no evita que un modelo alucine. Lo que cambia es que las afirmaciones sobre ti ya no quedan atrapadas dentro de un proceso generativo. Son un archivo que puedes leer, corregir y citar. MemoryLake está diseñado para esa tarea: una capa de memoria de la que leen tus asistentes, que contiene los documentos y datos que tú colocas allí en lugar de un resumen que el modelo escribió sobre ti.

Configurarlo requiere tres pasos.

Paso 1: Crea una clave de API

Genera una clave y realiza tu primera solicitud en unos 30 segundos. Esta es la credencial que tus asistentes y agentes usarán para leer y escribir en la memoria, por lo que debe estar en tu entorno o gestor de secretos, no pegada en un archivo de configuración que se sincronice o comparta.

Crea una clave de API de MemoryLake
Crea una clave de API de MemoryLake

Paso 2: Sube tus primeras memorias

Arrastra los documentos, imágenes y archivos que realmente describen tu situación: la descripción del puesto que escribiste, el informe del cliente, la guía de estilo, el documento de decisiones. Comienza con el material de origen en lugar de un resumen del mismo. Un resumen es una capa más donde puede entrar la inferencia, y el objetivo de este ejercicio es mantener una copia de lo que realmente se dijo.

Sube tus primeras memorias a MemoryLake
Sube tus primeras memorias a MemoryLake

Paso 3: Conecta tu IA y agentes

Dale a Claude, Codex, OpenClaw y otros agentes acceso a la memoria a través de MCP o la API. Para herramientas con soporte nativo de MCP, añade el servidor a la configuración de MCP de esa herramienta. Para productos de chat de consumo sin MCP (entre ellos ChatGPT y Perplexity), recupera la memoria relevante a través de la API e inyéctala en el prompt o en el flujo de trabajo que llama al modelo. De cualquier manera, el asistente ahora responderá a partir de un registro que puedes abrir.

Conecta tu IA y agentes a través de MCP
Conecta tu IA y agentes a través de MCP

Qué cambia esto en la práctica

El resultado no se vuelve necesariamente menos seguro. Lo que cambia es que puedes saber de dónde proviene esa seguridad.

Pide una biografía y obtendrás una basada en la descripción del puesto que subiste, con las partes que inventó ahora visiblemente desvinculadas de cualquier elemento del almacén. Haz la misma pregunta a dos asistentes diferentes y recurrirán al mismo material de origen, por lo que dejarás de obtener dos versiones imaginadas de ti de manera diferente, lo cual es la versión práctica del problema de una sola memoria en múltiples herramientas.

La acumulación también se detiene, por una razón estructural. Cuando el almacén contiene documentos y hechos declarados en lugar del resumen continuo que el modelo hace de ti, la respuesta de la quinta semana se construye a partir de las mismas fuentes que la de la primera semana. Una inferencia antigua no se convierte en un hecho por el simple hecho de estar en el archivo, porque nunca se escribió en él.

Y cuando algo está mal, la reparación es una reparación real. Corriges la fuente, no el síntoma, lo cual es una actividad muy diferente a corregir a un asistente que volverá a generar la misma suposición mañana.

Buenas prácticas para un perfil de usuario en el que puedas confiar

Almacena fuentes, no conclusiones

Sube el informe real en lugar de "el cliente prefiere un tono formal". La conclusión puede ser correcta, pero almacenada como una simple afirmación es indistinguible de algo que decidió un modelo. Almacenada como un documento con fecha, es una evidencia. Esta es la forma práctica del principio de procedencia que defiende el artículo.

Audita buscando detalles específicos seguros, no errores

Cuando revises lo que un asistente cree sobre ti, no busques solo errores. Busca detalles que sean sospechosamente específicos: un vecindario, una situación familiar, un hábito, una lectura de personalidad. Ahí es donde se concentra la invención, porque son los detalles que una tarea más requiere y que tu registro menos respalda. Que sea vago y correcto está bien; que sea específico y sin origen es la señal de alerta.

No uses la confianza del modelo como tu verificación

Dentro de un solo asistente, preguntar qué afirmaciones están fundamentadas te aporta algo. Entre asistentes, te da lo contrario de lo que esperarías. Por lo tanto, trata la autoevaluación como una señal débil dentro de una herramienta, y nunca como una razón para confiar en un producto sobre otro. La verificación que funciona es mirar el registro tú mismo.

Conclusión

Lo interesante de The Personalization Mirage no es que los modelos inventen cosas; eso ya lo sabían todos. Es que ocurre específicamente en la capa que se suponía que debía solucionar la personalización, a tasas que ningún modelo del estudio evitó, y que pedirle al modelo que se controle a sí mismo clasifica a los modelos en un orden prácticamente inverso al correcto.

La respuesta que se desprende del hallazgo no es un mejor prompt. Es separar el registro del generador: mantén lo que realmente dijiste en un almacén que puedas leer y corregir, permite que tus asistentes lean de él y deja de pedirle a un sistema que se gana la vida llenando vacíos que te diga qué partes eran vacíos. De este modo, los detalles específicos de sus respuestas se podrán rastrear hasta algo concreto, y los que no, quedarán expuestos por lo que realmente son.

Preguntas frecuentes

¿Significa el estudio que ChatGPT inventa el 42% de lo que recuerda sobre mí?

No, y esta distinción es importante. La media del 41.6% entre modelos es la proporción de afirmaciones que los modelos hicieron sobre perfiles sintéticos en las seis tareas de MirageBench, un banco de pruebas controlado con 150 perfiles construidos. No es una medición de la función de memoria de ningún producto en uso real. GPT-5.5, GPT-5.4-nano y GPT-4o-mini estuvieron entre los doce modelos evaluados, por lo que se probaron los modelos subyacentes; la función de memoria de ChatGPT como producto no se evaluó.

¿Qué modelos sobreinfirieron menos?

El artículo informa de un rango del 35% al 49% entre los modelos y proporciona una tabla de clasificación, pero la conclusión honesta es que la diferencia es estrecha y nadie se libró de ello. Elegir un modelo basándose en este eje no es una estrategia, especialmente porque el mismo estudio descubrió que los autoinformes a nivel de modelo apuntan en la dirección prácticamente opuesta a la correcta. Asume que este comportamiento está presente en cualquier herramienta que utilices.

¿Evitará una capa de memoria externa que el modelo alucine?

No. Cambia lo que puedes hacer al respecto. Un perfil generado es un artefacto que no puedes inspeccionar ni corregir en la fuente; un almacén externo es un archivo que puedes leer, editar y volver a señalar al modelo. La tendencia a inventar se mantiene; la diferencia es que ahora tienes una verdad de referencia con la cual comparar, que es a lo que se refiere el artículo con la verificación externa en lugar del autoinforme.

¿Es este el mismo problema que el de un asistente que olvida cosas?

Son dos caras de un mismo vacío. El olvido es lo que notas cuando el registro está vacío y el modelo no dice nada útil. La invención es lo que obtienes cuando el registro está vacío y el modelo produce algo de todos modos. Ambos provienen de la misma capa ausente, razón por la cual la recuperación por sí sola no es memoria: recuperar documentos en el momento de la consulta no te proporciona un registro duradero y corregible de lo que le has dicho al sistema.

¿Cómo compruebo lo que un asistente cree actualmente sobre mí?

Comienza con la propia configuración de memoria del producto y lee las entradas en lugar de pasarlas por alto (la mayoría de la gente nunca las ha mirado). Luego, pídele al asistente que escriba todo lo que cree saber sobre ti y compáralo con la lista de configuración. El vacío entre ambos es, aproximadamente, la capa inferida. Trata cualquier elemento en ese vacío como una hipótesis hasta que puedas rastrearlo a algo que realmente hayas dicho.