Puesto #3 IA Local / Privada — Tu Cerebro, tu Máquina, tus Reglas
Alibaba (Qwen Team)

Qwen3.8-Flash-Next

Un adelanto de la arquitectura de Qwen4 que almacena aproximadamente 180B parámetros, pero solo activa 6B por token. Lleva capacidad multimodal cercana a la frontera a máquinas con mucha RAM, si su peculiar licencia encaja con tu producto.

Actualizado 29 de agosto de 2026 Open WeightsQwen License125B MoE
Ideal para

Un adelanto de la arquitectura de Qwen4 que almacena aproximadamente 180B parámetros, pero solo activa 6B por token. Lleva capacidad multimodal cercana a la frontera a máquinas con mucha RAM, si su peculiar licencia encaja con tu producto.

Por qué gana

Artificial Analysis puntúa la vía alojada con 56 en Inteligencia y unos 77 tokens por segundo. El contexto nativo es de 262K, los GGUF agresivos de un bit comienzan alrededor de 72,5–75 GB y la enorme tabla de n-gramas puede mantenerse lejos de la escasa memoria del acelerador.

Ten en cuenta

El checkpoint abierto es experimental y no es el SKU alojado Qwen3.8-Flash. La Qwen Community License exige una licencia separada para negocios comerciales de MaaS y asistentes de trabajo con IA, las cuantizaciones más pequeñas pueden perder calidad y 75 GB siguen quedando muy lejos de una GPU de consumo normal.

01

Lo que realmente es

Los modelos de lenguaje modernos suelen ganar capacidad construyendo un almacén mayor de parámetros y moviendo más cajas para cada respuesta. Qwen3.8-Flash-Next intenta una organización más extraña: un almacén grande, un equipo activo pequeño y un índice gigantesco de frases que puede residir en memoria más barata.

El modelo de lenguaje principal tiene 125.000 millones de parámetros y activa unos seis mil millones por token. Una tabla de embeddings de n-gramas de 51.000 millones almacena patrones formados por secuencias cortas de tokens, y un módulo de predicción de varios tokens de aproximadamente cuatro mil millones ayuda a producir con eficiencia más de un token futuro. Redondeados en conjunto, los archivos describen unos 180.000 millones de parámetros. «6B activos» representa el trabajo de cada paso, no el tamaño del almacén.

La atención también es híbrida. La mayoría de las capas utilizan Gated DeltaNet, un sistema de atención lineal diseñado para transportar información con eficiencia. Periódicamente, Qwen Sparse Attention selecciona pequeños bloques relevantes del contexto anterior, en vez de examinar todos los tokens por igual. Imagina que lees un extenso archivo jurídico con un índice que señala unas pocas estanterías probables. El índice ahorra caminatas, pero los libros siguen existiendo.

El resultado impresiona en pruebas independientes. Artificial Analysis puntúa la vía alojada con 56 en su Intelligence Index y mide una decodificación de unos 77 tokens por segundo. Qwen comunica cifras sólidas en programación, trabajo de oficina y uso de herramientas, incluidos 62,5 en SWE-bench Pro y 73,9 en su CoWorkBench interno. Esas puntuaciones describen sistemas configurados con cuidado. No garantizan que una compilación local muy cuantizada se comporte igual.

El tamaño local depende del peldaño de la escalera que elijas. El BF16 oficial ocupa aproximadamente 360 GB en unidades decimales y el FP8 oficial unos 186 GB. Los GGUF más agresivos de Unsloth comienzan cerca de 72,5–75 GB, en parte porque la tabla de n-gramas conserva más precisión de la que sugiere un eslogan sencillo de «un bit para todo». Eso puede caber en un Mac con mucha memoria, un servidor o una estación de trabajo poco habitual. No cabe en una tarjeta gráfica normal de 24 GB, y la caché KV aún necesita espacio.

El contexto nativo es de 262.144 tokens. Static YaRN puede ampliarlo hacia un millón, pero Qwen advierte de que mantener siempre activo el escalado puede reducir la calidad con prompts más cortos. El producto alojado llamado Qwen3.8-Flash habilita por defecto un contexto de un millón de tokens y añade herramientas oficiales. Ese SKU alojado es un pariente cercano, no un sinónimo. Tiene sus propios precios de API, cachés, disponibilidad, límites y actualizaciones.

La licencia es la salvedad decisiva. Qwen Community License 1.0 permite de forma amplia el uso y la modificación, pero los negocios comerciales de MaaS y «AI Work Assistant» necesitan una licencia separada. La definición incluye explícitamente los asistentes independientes de programación y productividad de oficina. Los productos que superen 100 millones de usuarios mensuales o $20 millones de ingresos mensuales también deben mostrar de forma destacada el nombre del modelo. El uso interno puede estar exento cuando ningún tercero recibe el modelo, sus capacidades o sus salidas. Esto no es Apache 2.0.

Los primeros informes de la comunidad encajan tanto con la promesa de la arquitectura como con su juventud. Los operadores admiran la capacidad por parámetro activo y demuestran velocidades útiles en sistemas especializados. También hablan de exceso de razonamiento, gran consumo de contexto, fallos por falta de memoria, contaminación de la caché y kernels que exigen el runtime más reciente. Artificial Analysis contabilizó cerca de 200 millones de tokens de salida en su índice, casi el doble de la mediana comparativa.

Por tanto, Qwen3.8-Flash-Next no es la nueva opción local fácil y predeterminada. Ese lugar sigue correspondiendo a Qwen3.8-27B, cuyos archivos de cuatro bits se sitúan en la clase de 18 GB bajo Apache 2.0. Flash-Next es el escalón superior: un fascinante experimento para mucha RAM que puede acercarse al comportamiento de frontera sin requerir cómputo activo de frontera. Úsalo cuando encajen tu hardware, tu paciencia y la licencia, no solo porque seis mil millones parezcan pocos.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • Seis mil millones activos cambian la ecuación del cómputo: Un MoE de 125B enruta solo 10 expertos más uno compartido por token, mientras que una tabla de n-gramas de 51B amplía la memoria con relativamente poco cómputo. El diseño busca una gran capacidad sin activar un modelo gigantesco en cada paso.
  • La capacidad independiente es excepcionalmente alta: Artificial Analysis otorga a Flash-Next una puntuación de Inteligencia de 56, solo un punto menos que GLM-5.3-Flash, con una decodificación medida más rápida de unos 77 tokens por segundo.
  • Incluye bases multimodales y de contexto largo: El checkpoint acepta texto, imágenes y vídeo, ofrece 262.144 tokens nativos y puede configurarse hacia un millón mediante static YaRN.
  • El ecosistema de despliegue apareció con rapidez: Las vías oficiales o documentadas abarcan Transformers, vLLM, SGLang, TokenSpeed, llama.cpp, MLX, paquetes de Ollama y GGUF de Unsloth.

Limitaciones honestas

  • La licencia puede impedir el uso comercial más evidente: Un negocio comercial de MaaS o de «AI Work Assistant» independiente para programación u ofimática necesita una licencia separada de Qwen. Los productos grandes también están sujetos a condiciones para mostrar el nombre del modelo.
  • Flash-Next no es Flash alojado: Qwen3.8-Flash es un SKU de producción gestionado, con contexto de 1M de forma predeterminada y herramientas integradas. Su precio, límites, fiabilidad y salida no se pueden asignar de forma implícita a todos los checkpoints locales.
  • La cuantización más pequeña sigue siendo un proyecto para mucha RAM: Un paquete agresivo de estilo un bit ocupa unos 72,5–75 GB antes de la memoria de ejecución y contexto. El BF16 oficial ronda 360 GB decimales y FP8 unos 186 GB.
  • El razonamiento verboso y los runtimes jóvenes necesitan supervisión: Artificial Analysis observó cerca de 200M tokens de salida en su índice, y los primeros operadores informan de errores de memoria, problemas de caché, incompatibilidades de kernels y una calidad sensible a la configuración.
03

Resumen de Benchmarks

Artificial Analysis Intelligence Index — 56

Las pruebas independientes de la vía alojada sitúan Flash-Next cerca de la frontera de los pesos abiertos. No establecen la misma puntuación para una cuantización local de 75 GB.

Velocidad de salida — aproximadamente 77 tok/s

La decodificación es más rápida que en GLM-5.3-Flash según Artificial Analysis, aunque la primera respuesta tarda más en llegar porque el razonamiento y el tiempo hasta el primer token son fenómenos distintos.

GDPval-AA v2 — aproximadamente 1743 Elo en la captura consultada

Es una señal sólida en tareas profesionales, con un intervalo de confianza y una escala en vivo que cambia. Hay que fecharla y evitar presentar una pequeña diferencia como una victoria decisiva.

SWE-bench Pro — 62,5 (prueba de Qwen)

Muestra una sólida reparación de repositorios en el conjunto de tareas refinado por Qwen y con el arnés de Claude Code. Las correcciones de las tareas y el arnés obligan a atribuir el resultado, no a tratarlo como puntuación local universal.

OSWorld 2.0 — 19,4 binario / 52,3 parcial (prueba de Qwen)

Recuerda que unas puntuaciones sólidas en programación y trabajo de oficina no se convierten automáticamente en un uso completo del ordenador igual de sólido; el resultado binario estricto sigue siendo modesto.

04

El Veredicto

Qwen3.8-Flash-Next entra en IA Local / Privada en el puesto #3 con un 9,0. Qwen3.8-27B sigue siendo la mejor opción predeterminada para una máquina personal en el #1, mientras que GLM-5.3-Flash ocupa el #2 por su capacidad independiente ligeramente mayor, su contexto nativo de 1M y unos derechos MIT claros. Flash-Next es el intrigante peldaño intermedio: más rápido, con mucho menos cómputo activo y capaz de funcionar desde unos 75 GB con una cuantización agresiva. Elígelo para experimentos internos y trabajo local con mucha RAM después de leer la licencia. No construyas a su alrededor un asistente comercial alojado de programación hasta que Qwen confirme tu vía de licencia, ni utilices los resultados del Qwen3.8-Flash alojado como prueba de una cuantización local sin evaluar.

05

Preguntas frecuentes