Puesto #5 Ecosistema Diario — Los Asistentes Líderes
Alibaba / Qwen Team

Qwen3.8-Max

Qwen3.8-Max une un modelo cercano a la frontera con la familia Qwen: chat, investigación profunda, generación de imágenes y vídeo, aplicaciones y API. El nuevo buque insignia MoE de Alibaba entiende texto, imágenes y vídeo, ofrece 1M de tokens de contexto y cuesta bastante menos que las API de frontera más caras. Max es el cerebro; Qwen Studio es el taller creativo que lo rodea.

Actualizado 14 de agosto de 2026 Multimodal1M ContextDeep Research
Ideal para

Qwen3.8-Max une un modelo cercano a la frontera con la familia Qwen: chat, investigación profunda, generación de imágenes y vídeo, aplicaciones y API. El nuevo buque insignia MoE de Alibaba entiende texto, imágenes y vídeo, ofrece 1M de tokens de contexto y cuesta bastante menos que las API de frontera más caras. Max es el cerebro; Qwen Studio es el taller creativo que lo rodea.

Por qué gana

Qwen3.8-Max tiene 2,4T parámetros totales y 95B activos, 1M de contexto y precios de $2 entrada / $6 salida por millón de tokens. Alibaba informa 93,0 en PaperBench, 82,8 en IFBench y 86,6 en Terminal Bench 2.1. En una instantánea temprana de Frontend Code Arena ocupa el #4 con 1668 Elo; Qwen Studio añade investigación, herramientas de imagen y de vídeo.

Ten en cuenta

El lanzamiento es muy reciente. La gran tabla de benchmarks la publica Alibaba, las primeras pruebas independientes de programación son dispares y cuotas o facturación pueden causar fricción. Qwen ya es un ecosistema amplio, pero fuera de sus mercados principales no se integra tan naturalmente con los servicios cotidianos como Google, Microsoft u OpenAI.

01

Lo que realmente es

Qwen3.8-Max se entiende bien como un motor nuevo y potente dentro de un taller concurrido. El motor es el modelo insignia de Alibaba: 2,4 billones de parámetros en total y 95 mil millones activos por solicitud. El taller es Qwen Studio, con chat, Deep Research, imagen, vídeo y artefactos web. Para una tarea diaria, el taller puede importar tanto como el motor.

La atracción inmediata es el valor. La tarifa indicada, $2 de entrada y $6 de salida por millón de tokens, deja margen para análisis largos y una segunda revisión. El razonamiento largo sigue facturándose como salida, así que no todo será barato. Pero pagar menos por intento permite practicar un hábito sano: verificar una respuesta en lugar de creer a la primera frase pulida.

El modelo puede observar texto, imágenes y vídeo con hasta un millón de tokens de contexto. Un documento de estrategia, hoja de cálculo, maqueta, captura de panel y vídeo de un flujo roto pueden estar sobre la misma mesa. No es memoria perfecta ni juicio perfecto, pero evita muchos traspasos imprecisos entre investigación y trabajo visual.

Los resultados son prometedores, no concluyentes. Alibaba comunica valores fuertes en PaperBench, IFBench, OSWorld-Verified y Terminal Bench; la primera instantánea de Frontend Code Arena lo coloca #4 con 1668 Elo. Son especialmente interesantes las demostraciones concretas de autonomía: según Alibaba, el modelo trabajó 10–16 días sin supervisión desde una carpeta vacía, construyó un harness que evoluciona y produjo 265 commits, 127 pull requests y 151 issues. También describe un concurso de diálogo multimodal cuya precisión subió de 0,60 a 0,853 en 45 envíos, además de simulaciones largas de diseño de chips y comercio electrónico. Son informes de Alibaba, no validación independiente, pero ilustran la meta: una cadena profesional larga de trabajo, no solo una respuesta brillante.

La cautela es mayor en programación: 67,7 en SWE-bench Pro no sitúa al modelo entre los líderes para resolver incidencias en repositorios reales y algunos tests tempranos de bugs son mixtos. Construir una interfaz convincente y arreglar una base de código vieja son capacidades distintas. Qwen3.8-Max merece el #5 como alternativa versátil y económica: probarlo en una tarea real y acotada, revisar fuentes y resultados, y dejar que la evidencia independiente decida si se convierte en predeterminado.

Para elegirlo en el día a día, conviene hacer otra pregunta: ¿en qué parte del trabajo se pierde hoy el tiempo? Quien copia datos entre PDF, hojas de cálculo, capturas y grabaciones cortas puede beneficiarse de una misma superficie multimodal. Quien ya trabaja dentro de Gmail, Google Docs, Outlook o un entorno corporativo con permisos definidos quizá ahorre más tiempo con el asistente que ya está integrado allí. Un ecosistema no es solo una colección de funciones; también es la cantidad de traspasos que consigue eliminar.

Las demostraciones de autonomía se deben leer como estudios de caso, no como una promesa automática. Que haya 265 commits no demuestra que cada commit sea correcto, seguro o mantenible. Lo valioso es la forma de trabajo que Alibaba intenta mostrar: dividir un objetivo, usar herramientas, comprobar resultados y continuar sin perder el hilo. Para un equipo, la prueba sensata es un proceso pequeño y reversible—una investigación con fuentes, un prototipo o un análisis con lista de comprobación—antes de delegar una tarea crítica.

Desde el 14 de agosto, los primeros pesos Max sí están disponibles. El checkpoint descargable es de texto, usa 262.144 tokens de contexto nativo y puede ampliarse a unos 1,01M; el Max alojado añade visión, herramientas y 1M por defecto. Sus 2,4T parámetros totales siguen exigiendo un centro de datos, y conviene revisar los límites comerciales de la licencia antes de desplegarlo.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • Mucha capacidad por cada dólar de API: QwenCloud indica $2 de entrada y $6 de salida por millón de tokens, con caché a $0,25. Es aproximadamente la mitad de la salida de Kimi K3 en la clasificación anterior.
  • Puede examinar más que texto: Qwen3.8-Max acepta texto, imágenes y vídeo con 1M de tokens. Un informe, una captura de interfaz, un gráfico y una grabación pueden investigarse juntos.
  • La familia Qwen ofrece más que una ventana de chat: Qwen Studio reúne chat, Deep Research, artefactos web, generación de imágenes y vídeo, y aplicaciones web, móviles y de escritorio. Esas herramientas multimedia son de la familia, no necesariamente de cada llamada Max.
  • Las demostraciones de trabajo autónomo son inusualmente concretas: Alibaba dice que Qwen3.8-Max trabajó sin supervisión durante 10–16 días desde una carpeta vacía, creando un harness autoevolutivo con 265 commits, 127 pull requests y 151 issues. También informa que una prueba de intención multimodal pasó de 0,60 a 0,853 en 45 envíos. Son demostraciones del proveedor, pero muestran la escala profesional a la que apunta.
  • Su primer indicador de frontend es competitivo: Frontend Code Arena sitúa al modelo en 1668 Elo (#4) en una foto temprana. Es evidencia útil de interfaces preferidas por personas, no un veredicto completo sobre ingeniería.
  • El paso del chat al producto es práctico: Qwen Studio y la nube ofrecen API compatibles con OpenAI y Anthropic. Un equipo puede probar el modelo sin reconstruir toda su arquitectura de agentes.

Limitaciones honestas

  • Los números titulares son evidencia del fabricante: Harnesses, configuraciones y reintentos cambian los resultados. La tabla debe motivar una prueba, no sustituir una evaluación independiente.
  • Resolver incidencias en repositorios reales todavía no es una victoria clara: Alibaba informa 67,7 en SWE-bench Pro, por detrás de los mejores Claude, y las primeras suites de errores son irregulares. Probar el mismo fallo en el propio proyecto antes de migrar.
  • Amplio no significa integrado en todas partes: Qwen Studio no vive automáticamente en Gmail, Office, calendario, navegador y permisos corporativos de la mayoría. El acceso también puede ser más cómodo en Asia.
  • 1M de contexto es capacidad, no memoria perfecta: Páginas irrelevantes, objetivos vagos y datos enterrados pueden confundir al modelo. Conviene dividir el trabajo grande en puntos de control.
  • El acceso temprano puede tener asperezas: Usuarios señalan cuotas, facturación y rendimiento; el razonamiento intenso consume salida. Medir primero una tarea acotada y terminada.
  • Abierto no significa pequeño ni sin condiciones: Qwen3.8-2.4T-A95B ya está en Hugging Face y ModelScope, pero requiere infraestructura de centro de datos. Su licencia impone nombre visible y permiso separado al superar ciertos umbrales comerciales.
03

Resumen de Benchmarks

Frontend Code Arena — 1668 Elo (#4, temprano)

Señal temprana de preferencia humana para frontends terminados; puede cambiar con más comparaciones.

PaperBench — 93,0 (informado por Alibaba)

Resultado de investigación compleja informado por el proveedor, no garantía independiente.

IFBench — 82,8 (informado por Alibaba)

Fuerte seguimiento de instrucciones según el proveedor.

Terminal Bench 2.1 — 86,6 (informado por Alibaba)

Resultado alto de agente terminal; importan las diferencias de harness.

SWE-bench Pro — 67,7 (informado por Alibaba)

Rendimiento respetable de reparación, pero no líder.

04

El Veredicto

Qwen3.8-Max sustituye a Kimi K3 en el #5 de Everyday Ecosystem: una promesa temprana similar de frontera, menor coste operativo y una familia más amplia de investigación y creatividad. Es atractivo para quien alterna análisis documental, entrada visual, investigación, imagen, vídeo y código. La posición es deliberadamente provisional: las afirmaciones más amplias necesitan verificación independiente y la integración cotidiana aún no iguala a los líderes. Comprobar hechos, código y resultados importantes.

05

Preguntas frecuentes