Qué se ha lanzado y qué sigue siendo una incógnita
Las promesas
Qwen3.8-Max está construido en torno a 2.4 billones de parámetros y, según Alibaba, se sitúa por encima de los modelos insignia de pesos abiertos lanzados recientemente en algunos benchmarks. Se presentó de forma preliminar el 19 de julio de 2026 en la World AI Conference de Shanghái antes del lanzamiento de hoy. La variante preliminar, Qwen3.8-Max-Preview, está disponible a través del Token Plan de Alibaba Cloud y en Qoder y QoderWork, y Alibaba ha declarado que tiene la intención de publicar los pesos descargables la próxima semana.
Las advertencias, explicadas claramente
A fecha de 3 de agosto de 2026, las cifras de rendimiento principales son las de la propia Alibaba: las afirmaciones de benchmarks con las que lidera provienen de evaluaciones internas, y todavía no hay nada de Artificial Analysis, LMArena o un entorno de pruebas independiente que se pueda inspeccionar. Las señales externas que existen son escasas: posiciones en Arena.AI el día del lanzamiento (la principal entrada china entre los modelos de texto, segunda a nivel mundial en la tabla de visión) y una aparición anónima previa al anuncio en Code Arena. Esas son clasificaciones de preferencia, no una tabla de benchmarks con una metodología revelada. La cobertura del lanzamiento sitúa la arquitectura en un diseño de mezcla de expertos (mixture-of-experts) que activa aproximadamente 95 mil millones de los 2.4 billones de parámetros por solicitud, pero todavía no hay una ficha de modelo (model card) publicada ni una licencia. Nada de eso significa que el modelo sea débil; significa que nadie fuera de Alibaba puede decirte todavía qué tan fuerte es en tu carga de trabajo.
Por eso mismo deberías realizar tu propia evaluación. Y una evaluación real es donde aparece primero el problema del contexto.
Por qué cambiar de modelo reinicia tu contexto
La memoria del lado del modelo pertenece al proveedor
La función de memoria de cada proveedor está limitada a ese proveedor. Lo que Claude recuerda sobre ti se queda en Claude; lo que ChatGPT almacenó se queda en ChatGPT. Al cambiar de modelo no estás migrando la memoria, sino que estás iniciando una nueva, por diseño. El patrón se repite con cada ciclo de lanzamiento, que es la razón por la que existe esta familia de guías: el mismo reinicio ocurrió al cambiar a Kimi K3, al pasar a Claude Opus 5 y al adoptar DeepSeek V4.
Los pesos abiertos se lanzan con exactamente cero memoria
Cuando los pesos de Qwen3.8-Max lleguen la próxima semana, el autoalojamiento se convertirá en una opción, y vale la pena tener claro lo que obtienes. Los pesos son un motor de inferencia. No hay cuenta, ni almacén de memoria, ni capa de preferencias, ni historial. Un modelo de frontera servido localmente es la demostración más pura posible de que la memoria no es una característica del modelo: es algo que añades o algo que no tienes.
El enrutamiento multiplica el problema
El patrón interesante en este momento no es la adopción de un solo modelo, sino la orquestación: un modelo fuerte que dirige a otros más baratos para ampliar la cuota y paralelizar el trabajo. Es una buena idea económicamente y una mala para la continuidad: cada salto es un contexto nuevo, y el modelo barato que ejecuta el paso cuatro no tiene idea de lo que el modelo costoso concluyó en el paso dos. Terminas enviando la descripción de tu proyecto en cada llamada, o aceptando que cada participante trabaje a medias a ciegas. La versión general de esto se cubre en memoria multiagente.
Lo que la gente intenta
Un bloque de contexto copiado y pegado
El primer paso universal: un párrafo con el stack tecnológico, las convenciones y las restricciones al principio de cada sesión. Funciona, se desactualiza y pagas por ello en cada solicitud en cada modelo que estás probando.
Confiar en la ventana de contexto
Las ventanas de millones de tokens hacen que sea tentador tratar el contexto como memoria. Una ventana es lo que el modelo puede leer en este turno: sigues eligiendo lo que entra, pagas por ello en cada turno y comienzas de vacío la próxima vez. La recuperación (retrieval) tampoco cierra la brecha, por razones que vale la pena leer en por qué RAG no es memoria.
Vivir dentro de un solo proveedor
La opción que parece más segura: elegir un proveedor, usar su memoria y no salir nunca de ahí. Funciona hasta la semana en que un competidor lanza algo de 2.4 billones de parámetros a mitad de precio, y el coste de descubrirlo es un mes volviendo a explicar tu base de código.
La solución: mantén tu contexto en una capa que el modelo no pueda llevarse consigo
La respuesta duradera es dejar de almacenar el conocimiento del proyecto en el modelo que esté ganando actualmente. MemoryLake mantiene tu arquitectura, decisiones y convenciones en una capa de memoria que cualquier modelo o agente lee a través de MCP o la API, incluido uno autoalojado.
Paso 1: Crea una clave de API
Genera una clave y realiza tu primera solicitud en unos 30 segundos.

Paso 2: Sube tus primeras memorias
Arrastra los documentos, imágenes y archivos que contienen tu contexto real: notas de arquitectura, ADRs, runbooks, especificaciones de API, resultados de evaluaciones previas y las decisiones que no dejas de volver a explicar.

Paso 3: Conecta tu IA y tus agentes
Da acceso a esa memoria a Claude, Codex, OpenClaw y tus otros agentes a través de MCP o la API, y apunta lo que sea que uses para llamar a Qwen3.8-Max a la misma capa. Ahora, cada modelo en tu combinación comienza desde el mismo resumen, lo cual es también la única forma justa de compararlos. Las configuraciones entre diferentes herramientas se cubren en una memoria en ChatGPT, Claude y Gemini.

Qué cambia esto en la práctica
Calcula el coste de la evaluación que estás a punto de realizar. Volver a poner al día a un nuevo modelo sobre tu proyecto requiere entre 30 y 60 minutos de trabajo concentrado, más otros pocos minutos al inicio de cada sesión posterior. Si tu contexto permanente es de 2,000 tokens y se vuelve a enviar 20 veces al día en los modelos que estás probando, eso equivale aproximadamente a 1.2 millones de tokens al mes de pura repetición: poco dinero, pero una fricción significativa.
El coste estratégico es mayor y más silencioso: los equipos que se beneficiarían de cambiar a menudo no lo hacen porque el impuesto de reconstrucción del contexto hace que cada evaluación parezca costosa. Cuando la memoria es externa, probar Qwen3.8-Max con tu carga de trabajo real cuesta una tarde en lugar de un mes, y descartarlo si pierde no cuesta absolutamente nada. Esa opcionalidad vale más que la línea de benchmark de cualquier modelo individual, especialmente uno que aún no ha sido verificado de forma independiente.
Buenas prácticas para un mundo multimodelo
Evalúa cada modelo con la misma memoria
Si un modelo recibe un resumen detallado escrito a mano y el siguiente recibe un copiado rápido, estás comparando prompts, no modelos. Alimenta a ambos desde la misma capa de memoria y la comparación se centrará en el modelo.
Almacena decisiones, no transcripciones
"Postgres sobre Redis para el historial de chat: Redis perdió datos bajo trabajadores en modo cola, decidido en 2026-05" es un hecho duradero. Los cuarenta mensajes que lo produjeron son ruido y cuesta tokens recuperarlos.
Mantén la capa independiente del proveedor
Lo que sea que uses para contener la memoria no debería ser algo que un proveedor de modelos pueda dejar obsoleto por ti. Esto se aplica a los modelos alojados y a la compilación autoalojada de Qwen que podrías estar ejecutando la próxima semana: la memoria debería sobrevivir a ambos.
Conclusión
Qwen3.8-Max es un lanzamiento serio: 2.4 billones de parámetros, promesas de nivel de frontera, pesos prometidos dentro de la semana. También es, a fecha de 3 de agosto de 2026, un modelo cuyas cifras principales todavía provienen de su creador, sin ficha de modelo ni licencia publicadas aún, lo cual es una razón para probarlo tú mismo, no una razón para descartarlo.
De cualquier manera, el modelo es la parte reemplazable. Tu arquitectura, tus convenciones y las decisiones que tu equipo ya tomó no lo son. Mantén eso en una capa de memoria que cualquier modelo pueda leer, y cambiar a Qwen3.8-Max (o dejarlo el próximo mes) se convertirá en un cambio de configuración en lugar de un mes volviendo a explicar lo que ya sabías.