Por qué ChatGPT olvida lo que dijiste antes
La ventana tiene un límite, y tú no lo ves
Cada modelo tiene un contexto máximo. Una conversación larga eventualmente lo supera, momento en el cual algo tiene que desaparecer: los turnos anteriores se descartan o se comprimen para que quepan los más recientes.
La interfaz no te muestra esto. No hay ninguna línea en el hilo que marque dónde comienza la vista del modelo. Así que, desde tu lado, el mensaje está visiblemente presente y siendo ignorado; desde el lado del modelo, no está allí. Ese desajuste es la experiencia completa de este problema, y es por eso que la solución siempre parece ser repetirte con más firmeza.
Incluso dentro de la ventana, la posición importa
Esta es la parte que la mayoría de la gente no sabe, y es la mejor explicación para los casos en los que el hilo claramente todavía cabe.
El hallazgo proviene de Lost in the Middle: How Language Models Use Long Contexts (Liu et al., TACL 2023). Probaron la respuesta a preguntas sobre múltiples documentos y la recuperación de clave-valor mientras movían la ubicación de la información relevante, y reportaron que "el rendimiento suele ser mayor cuando la información relevante ocurre al principio o al final del contexto de entrada, y se degrada significativamente cuando los modelos deben acceder a información relevante en medio de contextos largos, incluso para modelos explícitamente diseñados para contextos largos".
Lleva eso a un chat. Tus instrucciones de configuración están al principio: buena posición. Tu último mensaje está al final: buena posición. La restricción que agregaste en el mensaje treinta de noventa está en el medio, que es la posición más débil de la entrada. No había nada confuso en ella; simplemente quedó mal ubicada por el paso del tiempo.
La capacidad efectiva es menor que la cifra anunciada
El segundo efecto es que el tamaño de contexto declarado es un límite superior, no una capacidad de trabajo.
RULER: What's the Real Context Size of Your Long-Context Language Models? (Hsieh et al., 2024) creó un benchmark sintético que va más allá de la simple recuperación de una aguja en un pajar para incluir el rastreo y la agregación de múltiples saltos, y evaluó 17 modelos de contexto largo. Su conclusión: a pesar de obtener puntuaciones casi perfectas en la prueba de recuperación estándar, "casi todos los modelos muestran grandes caídas de rendimiento a medida que aumenta la longitud del contexto", y aunque todos los modelos afirmaban tener 32K tokens o más, "solo la mitad de ellos puede mantener un rendimiento satisfactorio a una longitud de 32K".
Esa evaluación es de 2024 y los modelos específicos ya han sido reemplazados, así que léelo como una forma de establecer la naturaleza del problema más que como una tabla de clasificación actual. La tendencia se mantiene: el número en la hoja de especificaciones describe lo que cabe, no lo que el modelo utiliza bien, y las tareas que requieren razonamiento a través de piezas dispersas se degradan antes que las tareas que solo recuperan un dato.
Nada te dice qué se descartó
El factor agravante es el silencio. Cuando los turnos anteriores se recortan o comprimen, no recibes ningún aviso. Los profesionales que escriben sobre sesiones largas de agentes describen lo mismo desde el lado de las herramientas: una instrucción del principio de una sesión no se está ignorando, es que el modelo ya no puede acceder a ella de manera fiable.
Así que no puedes distinguir entre "no siguió la restricción" y "la restricción ya no está en su campo de visión", y ambas situaciones requieren respuestas opuestas. La primera exige una instrucción más clara. La segunda exige reestructurar la conversación, y ninguna cantidad de énfasis lo solucionará.
Lo que la gente intenta
Repetir la instrucción. Efectivo, de inmediato, y no te dice nada sobre el porqué. También infla el hilo, lo que acerca el siguiente fallo. Esta es la rueda de hámster en la que se encuentra la mayoría de la gente.
Poner todo lo crítico en el primer mensaje. Realmente inteligente: el principio es una posición fuerte. Se mantiene hasta que el hilo crece lo suficiente como para que el principio se recorte, y no ayuda con las restricciones que descubres en el mensaje cuarenta.
Iniciar un nuevo chat. El movimiento individual más fiable, y la razón por la que los usuarios experimentados lo hacen constantemente. El coste es que también descartas todo lo útil, por lo que estás cambiando un hilo degradado por uno vacío.
Pedirle que resuma antes de continuar. Una técnica real: hacer que vuelva a enunciar las restricciones y luego trabajar a partir de ese resumen cerca del final del contexto. Efectivo y con pérdida: estás comprimiendo, y lo que se descarta lo elige el modelo.
Instrucciones personalizadas para las partes estables. Subestimado, porque estas se vuelven a suministrar en cada solicitud en lugar de vivir en el historial. El bloque es pequeño, por lo que contiene tu puñado de reglas permanentes, no los detalles específicos de esta tarea. Vale la pena usarlo correctamente, y es distinto de las instrucciones que se configuran pero no surten efecto, lo cual es un problema diferente.
Volver a subir el documento. Común, y lucha contra la misma corriente: un archivo subido que se sale del contexto a mitad del hilo es este mismo mecanismo visto desde el lado del archivo.
Nota lo que tienen en común todas las soluciones temporales. Todas son formas de gestionar un historial que se está utilizando como almacenamiento.
La solución: dejar de usar la conversación como almacenamiento
El error estructural es tratar el hilo como el registro. Una conversación es una superficie de trabajo: buena para pensar, mala para la retención y activamente mala cuando es larga. Una vez que tus requisitos solo existen como mensajes, quedan sujetos a los efectos de posición, el recorte y la compresión, nada de lo cual puedes ver.
Así que saca los requisitos de ahí. Mantén la restricción, la especificación, el esquema, la decisión en un almacén del que lea el asistente, y deja que cada conversación sea corta y desechable. Un hilo corto no tiene un medio en el que perderse.
Ese es el mecanismo honesto, y vale la pena ser precisos sobre lo que hace y lo que no hace: una capa de memoria no amplía la ventana de contexto ni soluciona la atención dentro de una entrada larga. Nada lo hace. Lo que cambia es que ya no necesitas que el hilo sea largo, porque el material duradero se recupera en lugar de volver a enunciarse, por lo que puedes trabajar en el régimen donde los modelos son fiables en lugar de gestionar el régimen donde no lo son.
MemoryLake es una capa de memoria para eso: tus documentos, restricciones y decisiones en un solo almacén, legible desde ChatGPT a través de la API y desde herramientas compatibles con MCP como Claude y Codex directamente. Nuevo chat, mismo conocimiento, sin hilos de noventa mensajes.
Paso 1: Crear una clave de API
Genera una clave y realiza tu primera solicitud en unos 30 segundos. Manténla en tu entorno o en un gestor de secretos en lugar de pegarla en una ventana de chat.

Paso 2: Subir tus primeras memorias
Arrastra los documentos, imágenes y archivos que actualmente vuelves a explicar: la especificación, las restricciones, la guía de estilo, el esquema, las decisiones. Sube las fuentes en lugar de resúmenes siempre que puedas; estás intentando específicamente escapar de un flujo de trabajo donde todo es una compresión de otra cosa.

Paso 3: Conectar tu IA y agentes
Dale a Claude, Codex, OpenClaw y otros agentes de IA acceso a la memoria a través de MCP o la API. ChatGPT no tiene cliente MCP, así que recupera lo que necesites a través de la API e inyéctalo en el prompt, en las instrucciones de un GPT personalizado o en el flujo de trabajo que llama al modelo. Las herramientas que hablan MCP leen el mismo almacén directamente.

Qué cambia esto en la práctica
La primera diferencia es que tus hilos se vuelven más cortos, y esa es toda la ganancia. Diez conversaciones cortas que comienzan cada una desde el mismo contexto recuperado superan a un hilo de noventa mensajes que se degrada en el medio, no porque sean más ordenadas, sino porque las entradas cortas son donde los modelos realmente rinden.
La segunda es que la pregunta "¿se olvidó o desobedeció?" pasa a tener respuesta. Cuando la restricción se suministra con la solicitud en lugar de estar treinta mensajes atrás, un fallo al seguirla es un fallo real al seguirla, y puedes responder a lo que realmente está sucediendo.
La tercera es que empezar de cero deja de costarte nada. En este momento, un nuevo chat significa volver a explicar; por eso la gente estira los hilos mucho más allá del punto de fiabilidad. Cuando el conocimiento se recupera, un nuevo chat es gratis, y el constante volver a explicar deja de ser el precio de un contexto limpio.
And it composes with the built-in memory rather than fighting it. Saved memory stays what it's good at — a page or two of stable preferences that doesn't fill up because you're not using it as a filing cabinet.
Buenas prácticas para conversaciones largas
Trata la longitud del hilo como un recurso que gastas
Decide de antemano aproximadamente qué longitud debe alcanzar un hilo de trabajo y comienza uno nuevo cuando la superes. La mayoría de la gente va mucho más allá del punto de fiabilidad porque la alternativa es volver a explicar. Resuelve el problema de volver a explicar y esto se volverá fácil.
Coloca las restricciones críticas al final, no solo al principio
La posición trabaja para ti tanto como en tu contra. Si algo debe cumplirse para la siguiente respuesta, vuelve a enunciarlo en el mensaje que estás enviando: el final de la entrada es una posición fuerte. Es por esto que repetir funciona, y hacerlo deliberadamente para las dos o tres cosas que importan supera a hacerlo de forma reactiva para todo.
Resume a propósito, en un límite que tú elijas
Cuando un hilo se haya vuelto largo, pide una redefinición explícita de los requisitos, verifícala, corrígela y luego inicia un nuevo chat con eso como mensaje de apertura. Estás haciendo la compresión tú mismo, con revisión, en lugar de dejar que un recorte invisible elija por ti.
Nunca dejes que una decisión exista solo en un historial
Si algo va a seguir siendo cierto la próxima semana, pertenece a un documento o a un almacén, no al mensaje cuarenta. Este es el único hábito que evita toda esta clase de problemas, y también es lo que hace que el hilo sea seguro de abandonar.
Sospecha de la posición antes de sospechar del modelo
Cuando se deje de seguir una instrucción, comprueba dónde se encuentra en la conversación antes de volver a escribirla. Algo establecido al principio de un hilo largo está en la posición más débil de la entrada, y la respuesta correcta es la reestructuración, no la reformulación.
Conclusión
ChatGPT olvida lo que dijiste antes en la misma conversación porque las entradas largas se manejan de manera desigual. La información en medio de un contexto largo se utiliza con menor fiabilidad que la información al principio o al final; ese es el hallazgo de Lost in the Middle, y se mantuvo incluso para modelos construidos explícitamente para contextos largos. And usable capacity runs well below the advertised number, which is what RULER demonstrated when half the models claiming 32K couldn't hold up at 32K. Tu restricción no fue ignorada; para el mensaje noventa estaba en la peor posición de una entrada más larga de lo que el modelo maneja bien.
Lo que significa que la solución no es una técnica de prompt. Deja de usar el historial como tu registro: mantén el material duradero en un almacén del que lea el asistente, mantén las conversaciones cortas e inicia nuevas libremente. Terminarás trabajando en el rango donde los modelos son fiables, en lugar de volverte mejor gestionándolos donde no lo son.