Puesto #8 Ecosistema Diario — Los Asistentes Líderes
Alibaba / Qwen Team

Qwen3.8-Max

Qwen3.8 ahora tiene dos formas importantes: el producto Qwen3.8-Max alojado con visión, herramientas integradas y un contexto predeterminado de 1M, y el primer punto de control descargable de nivel Max de Qwen. El modelo abierto es un modelo de texto de 2.4T en total, 95B activos, con un contexto nativo de 262K ampliable a aproximadamente un millón de tokens.

Actualizado 30 de agosto de 2026 Multimodal1M ContextDeep Research

Actualización de la clasificación La clasificación de Ecosistema Diario se ha revisado desde la última actualización de esta reseña (30 de agosto de 2026). El puesto que aparece arriba siempre está al día. N.º 1 actual: Claude Opus 5.5

Ideal para

Qwen3.8 ahora tiene dos formas importantes: el producto Qwen3.8-Max alojado con visión, herramientas integradas y un contexto predeterminado de 1M, y el primer punto de control descargable de nivel Max de Qwen. El modelo abierto es un modelo de texto de 2.4T en total, 95B activos, con un contexto nativo de 262K ampliable a aproximadamente un millón de tokens.

Por qué gana

Qwen3.8-2.4T-A95B está disponible en Hugging Face y ModelScope, con compatibilidad oficial para vLLM, SGLang y TokenSpeed. Alibaba reporta 93.0 en PaperBench y 86.6 en Terminal Bench 2.1. El modelo Max alojado añade entrada de imagen/video, modo sin pensar (non-thinking), herramientas integradas, contexto predeterminado de 1M y precios de API de $2/$6.

Ten en cuenta

Este es un lanzamiento muy reciente. La impresionante y amplia tabla de benchmarks proviene de Alibaba, no de un laboratorio independiente; los primeros informes de programación independientes son mixtos y el acceso, las cuotas y la facturación pueden ser incómodos. Qwen es un ecosistema cada vez más completo, pero su integración con los servicios que muchos lectores ya usan aún no es tan fluida como la de Google, Microsoft u OpenAI, especialmente fuera de Asia.

01

Lo que realmente es

Qwen3.8-Max es más fácil de entender como un motor nuevo y poderoso estacionado en un taller muy concurrido. El motor es el modelo insignia de Alibaba: un diseño de mezcla dispersa de expertos (sparse Mixture-of-Experts) con 2.4 billones de parámetros totales y 95 mil millones activos en una solicitud. El taller es Qwen Studio, donde ese motor se asienta junto al chat, la Investigación Profunda (Deep Research), la generación de imágenes, la generación de video y las herramientas para crear artefactos web. Para un usuario común, el taller puede importar tanto como el motor.

El atractivo práctico inmediato es su valor. La tarifa anunciada de QwenCloud es de $2 por millón de tokens de entrada y $6 por millón de tokens de salida, con entrada en caché a $0.25. Eso no hace que cada trabajo sea barato —el razonamiento prolongado se factura como salida—, pero hace que el análisis de contexto grande y la experimentación repetida sean mucho más fáciles de justificar que las tarifas premium de los líderes absolutos. Si Kimi K3 era el modelo completo capaz que necesitaba un presupuesto cuidadoso, Qwen3.8-Max es la alternativa similarmente ambiciosa que deja más espacio en el presupuesto para un segundo intento y una revisión adecuada.

También está diseñado para observar el problema, no solo para leer sobre él. El modelo acepta texto, imágenes y video con hasta un millón de tokens de contexto. Imagine investigar el lanzamiento de un producto con su documento de estrategia, hoja de cálculo, prototipo, captura de pantalla del tablero y una grabación de un flujo de trabajo defectuoso, todo en el mismo escritorio. Eso no le otorga mágicamente al modelo una memoria o un juicio perfectos, pero elimina varios de los incómodos pasos de traducción que generalmente separan la investigación del trabajo visual.

La historia de la familia de productos es inusualmente útil para el trabajo diario. Qwen Studio ofrece chat, Deep Research, generación de imágenes, generación de video y artefactos de desarrollo. El punto de control descargable no es idéntico a ese producto alojado: es solo texto, usa un contexto nativo de 262K y puede extenderse a aproximadamente 1.01M; el modelo Max alojado añade visión, soporte para modo sin pensar, herramientas integradas y un contexto predeterminado de 1M. Esa distinción evita que una característica publicitada en la tarjeta del modelo se convierta en una desagradable sorpresa al momento de su despliegue.

La prometida versión abierta ahora es real. Qwen3.8-2.4T-A95B se puede descargar desde Hugging Face y ModelScope, con 512 expertos y 10 asignados más un experto compartido activo por token. Aún no es un modelo para computadoras portátiles: almacenar y servir 2.4 billones de parámetros es un proyecto de centro de datos. La licencia personalizada es amplia para uso ordinario, pero los productos muy grandes deben mostrar el nombre del modelo, y las grandes empresas de servicios de modelos o asistentes de oficina/programación pueden necesitar una licencia comercial separada.

La historia de rendimiento es prometedora, pero no está completa. Alibaba reporta excelentes resultados en PaperBench, IFBench, OSWorld-Verified, Terminal Bench 2.1 y una amplia tabla multimodal. En la primera instantánea de Frontend Code Arena, Qwen3.8-Max se ubica en el #4 con 1668 Elo. Aún más interesante es que Alibaba describe varias demostraciones inusualmente concretas de trabajo autónomo: una ejecución desatendida de 10 a 16 días desde una carpeta vacía que construyó un entorno de prueba auto-evolutivo, realizó 265 commits, abrió 127 pull requests y registró 151 issues; un concurso de intención de diálogo multimodal en el que la precisión aumentó de 0.60 a 0.853 a través de 45 envíos; y extensas simulaciones de diseño de chips y comercio electrónico. Estos son los propios informes de Alibaba, no una validación independiente, pero son una imagen útil del trabajo profesional de múltiples pasos al que apunta el equipo. La evaluación independiente todavía tiene que hacer el trabajo lento y un poco aburrido que hace que una tabla de clasificación sea confiable.

Esa precaución es más importante en la programación. El resultado reportado de Terminal Bench de Qwen es sólido, pero su 67.7 en SWE-bench Pro no lo ubica entre los líderes al resolver problemas en repositorios reales. Unas pocas pruebas prácticas tempranas de corrección de errores también han sido mixtas. Un benchmark puede mostrar que un modelo tiene una poderosa caja de herramientas; solo una ejecución repetible en su repositorio demuestra si recuerda el objetivo, usa los comandos correctos y corrige el error en lugar de escribir uno nuevo, hermosamente explicado.

También hay límites en el producto. La disponibilidad, las cuotas, la facturación y el rendimiento (throughput) varían según la región, mientras que el autoalojamiento (self-hosting) requiere una infraestructura seria y una revisión de la licencia. Por ahora, Qwen3.8-Max obtiene el #6 con un 9.0, inmediatamente detrás de Grok 4.6. Úselo para una tarea limitada, verifique sus hechos y el código, y permita que los resultados independientes, no el entusiasmo de la semana de lanzamiento, decidan si se convierte en su predeterminado.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • Mucha capacidad de modelo insignia por el precio de la API: QwenCloud lista $2 por millón de tokens de entrada y $6 por millón de tokens de salida, con la entrada en caché a $0.25. Esto es aproximadamente la mitad del precio de salida de Kimi K3 en la clasificación anterior y muy por debajo de los niveles más caros de Claude, lo que hace que la experimentación seria sea mucho menos dolorosa.
  • Puede inspeccionar más que solo texto: Qwen3.8-Max admite de forma nativa texto, imágenes y video y tiene una ventana de contexto de 1 millón de tokens. Por lo tanto, un informe largo, una captura de pantalla de la interfaz de usuario, un gráfico y una breve grabación de pantalla pueden formar parte de una sola investigación en lugar de transferencias separadas y con pérdida de información.
  • La familia Qwen ofrece a los usuarios comunes más que un chatbot: Qwen Studio combina chat con Investigación Profunda (Deep Research), artefactos de desarrollo web, generación de imágenes y generación de video, y está disponible en la web además de las principales plataformas de escritorio y móviles. Esas herramientas de medios generativos son productos de la familia; no confunda eso con una afirmación de que el modelo Max por sí solo produce todos los resultados.
  • Las demostraciones de trabajo autónomo son inusualmente concretas: Alibaba afirma que Qwen3.8-Max funcionó sin supervisión durante 10 a 16 días desde una carpeta vacía, construyendo un entorno de prueba en constante evolución que realizó 265 commits, 127 pull requests y 151 issues. También reporta un desafío de intención multimodal de 45 entregas que mejoró del 0.60 al 0.853 de precisión. Estas son demostraciones del proveedor, pero muestran el tipo de flujo de trabajo profesional sostenido al que apunta Alibaba.
  • Su primera señal pública en el frontend es genuinamente competitiva: Frontend Code Arena ubica al modelo #4 con 1668 Elo en una instantánea temprana, con resultados particularmente fuertes en productos de consumo. Ese no es un veredicto completo sobre la programación, pero es una evidencia útil de que Qwen puede hacer interfaces que las personas prefieren.
  • El nivel Max por fin se puede descargar: Qwen3.8-2.4T-A95B se publica en Hugging Face y ModelScope con 2.4T de parámetros en total / 95B activos, un contexto nativo de 262,144 tokens y una extensión a aproximadamente 1.01M. vLLM, SGLang y TokenSpeed se nombran como entornos de ejecución (runtimes) compatibles.

Limitaciones honestas

  • Considere la tabla principal de benchmarks como evidencia del proveedor, no como un hecho establecido: Los números de Alibaba son útiles, pero muchas comparaciones utilizan entornos (harnesses) y configuraciones de agentes que pueden cambiar el resultado. Las suites independientes no han alcanzado ese nivel del todo, por lo que las afirmaciones sobre PaperBench y Terminal Bench deben guiar una prueba, no reemplazarla.
  • Resolver problemas en repositorios reales aún no es una victoria clara: Alibaba reporta 67.7 en SWE-bench Pro, detrás de los resultados más fuertes de Claude, y los primeros informes de resolución de errores han sido mucho más débiles que la tabla de lanzamiento. Para un parche en producción, ejecute el mismo problema a través de Qwen y su líder actual antes de cambiar su modelo predeterminado.
  • El ecosistema es amplio, pero no está universalmente integrado: Qwen Studio tiene una atractiva familia de herramientas, pero no vive automáticamente dentro de Gmail, los archivos de Office, los navegadores, los calendarios o los permisos de la empresa de la mayoría de los lectores. El alcance y la disponibilidad del servicio de Alibaba también pueden ser más convenientes en Asia que en otros lugares.
  • Una ventana de contexto de 1M es capacidad, no memoria perfecta: Puede contener una enorme cantidad de material, pero las páginas irrelevantes, los objetivos vagos y los datos enterrados en el medio aún pueden desviar al modelo. Divida los proyectos grandes en puntos de control y mantenga los documentos fuente disponibles para su verificación.
  • El acceso temprano puede ser complicado en algunos aspectos: Los evaluadores han informado sobre fricciones con las cuotas, la facturación y el rendimiento (throughput), mientras que la configuración de razonamiento alto del modelo puede gastar una cantidad sustancial de tokens de salida. Comience con una tarea limitada y rastree el costo de un resultado final y verificado, no solo la tarifa de tokens anunciada.
  • Abierto no significa que no requiera esfuerzo o esté libre de restricciones: Un punto de control de 2.4T es de escala de centro de datos incluso con 95B activos por token. La licencia personalizada requiere nombrar el modelo si se superan los 100M de usuarios mensuales o $20M de ingresos mensuales, y una licencia separada para grandes empresas de servicios de modelos o de asistencia de oficina/programación de IA por encima de $50M de ingresos anuales.
03

Resumen de Benchmarks

Frontend Code Arena — 1668 Elo (#4, temprano)

Una señal temprana de preferencia humana para trabajos terminados en frontend. Es alentador, pero el rango y el Elo se moverán a medida que lleguen más comparaciones.

PaperBench — 93.0 (Reportado por Alibaba)

Un resultado reportado por el proveedor para trabajos complejos de estilo de investigación. Respalda la ambición del modelo, no es una garantía independiente.

IFBench — 82.8 (Reportado por Alibaba)

Una sólida puntuación reportada por el proveedor para el seguimiento de instrucciones, relevante cuando una tarea tiene muchas limitaciones y pasos.

Terminal Bench 2.1 — 86.6 (Reportado por Alibaba)

Un alto resultado de agente de terminal, por debajo de la puntuación citada de GPT-5.6 Sol y por encima de varios rivales en la tabla de Alibaba; las diferencias en el entorno del agente (harness) importan.

SWE-bench Pro — 67.7 (Reportado por Alibaba)

Un desempeño respetable en ingeniería de software, pero no una puntuación líder en la categoría de reparación de repositorios.

04

El Veredicto

Qwen3.8-Max se ubica en el #6 con un 9.0 corregido por fórmula en el Ecosistema Diario. Grok 4.6 se coloca por encima porque su 9.5 combina evidencia independiente más fuerte con una distribución de agentes listos para usar más amplia. Qwen sigue siendo atractivo para las personas que cambian entre documentos, entrada visual, investigación, imágenes, video y programación a un costo operativo menor. Pruébelo en una tarea limitada y mantenga las citas, las pruebas y la revisión humana en el proceso.

05

Preguntas frecuentes