Puesto #1 IA Local / Privada — Tu Cerebro, tu Máquina, tus Reglas
Alibaba (Qwen Team)

Qwen3.8-27B

Qwen3.8-27B es uno de esos raros modelos locales cuyos compromisos encajan con el hardware que la gente realmente tiene: un checkpoint denso de 27B para texto, imágenes, vídeo, programación y agentes con herramientas. Una versión de 4 bits cabe en una GPU de 24 GB, y Apache 2.0 permite mantener el trabajo privado y usarlo comercialmente.

Actualizado 26 de agosto de 2026 Open WeightsApache 2.027B Dense
Ideal para

Qwen3.8-27B es uno de esos raros modelos locales cuyos compromisos encajan con el hardware que la gente realmente tiene: un checkpoint denso de 27B para texto, imágenes, vídeo, programación y agentes con herramientas. Una versión de 4 bits cabe en una GPU de 24 GB, y Apache 2.0 permite mantener el trabajo privado y usarlo comercialmente.

Por qué gana

Las pruebas independientes ya dan respaldo real al relato del lanzamiento: Qwen3.8-27B obtiene 52 en el Artificial Analysis Intelligence Index y 51 en su Agentic Index, mientras que el ranking Image-to-WebDev de Arena lo sitúa #7 entre sistemas de frontera mucho mayores. Las cifras de programación y uso del ordenador de Qwen siguen siendo sólidas, y el modelo reúne 262K de contexto, razonamiento regulable, visión y vídeo nativos y licencia Apache 2.0.

Ten en cuenta

Los índices independientes respaldan la capacidad general y agéntica del modelo, pero la mayoría de cifras concretas de programación y uso del ordenador aún proceden de los arneses de Qwen. El ajuste xhigh predeterminado puede ser desesperadamente lento y verboso en hardware local; conviene empezar con low o medium, o desactivar el pensamiento para el trabajo interactivo corriente. La cuantización Q4 y los límites de la caché KV siguen separando una descarga de 18 GB de un uso práctico con 262K de contexto.

01

Lo que realmente es

Imagina que eliges un taller, no un solo martillo. Un modelo local debe entrar por la puerta, dejar espacio en la mesa, entender el material y usar herramientas sin sacar datos privados fuera. Qwen3.8-27B resulta atractivo porque reúne esas condiciones en un checkpoint. Es un modelo denso de visión y lenguaje con 27.000 millones de parámetros sobre la base híbrida de Qwen3.5: repite tres capas Gated DeltaNet y una capa de atención completa. La atención lineal ayuda a la eficiencia; la atención completa periódica mantiene conexiones entre detalles lejanos.

Aquí “multimodal” no es un botón decorativo. Qwen lo entrena y distribuye para texto, imágenes y vídeo. Un agente de programación local puede inspeccionar una captura, leer un diálogo de error, compararlo con el código y operar herramientas sin mandar antes la imagen a un servicio de visión en la nube. La ficha también habla de documentos, gráficos, navegadores, móviles y vídeos de una hora. Por eso se parece más a un banco de trabajo privado que a un autocompletado especializado.

Las cifras iniciales explican el entusiasmo: 61,7 en SWE-bench Pro, 73,0 en Terminal Bench 2.1, 42,2 en DeepSWE 1.1 y 90,3 en LiveCodeBench v6. Para agentes multimodales, Qwen declara 84,3 en OSWorld-Verified, 64,8 en WebArena-Verified y 70,7 en CoWorkBench. Frente a Qwen3.6-27B, la mejora aparece en reparación de repositorios, terminal, trabajo de oficina y control del ordenador. Esa amplitud dice más que un récord aislado.

Las primeras mediciones externas apuntan ahora en la misma dirección general. Artificial Analysis da a la configuración xhigh 52 en su Intelligence Index y 51 en su Agentic Index; en la captura citada, este último supera por poco el resultado histórico de Opus 4.8 con esfuerzo max. En la clasificación Image-to-WebDev de Arena, Qwen3.8-27B estaba #7, con 1574 puntos y 1.686 votos el 25 de agosto, y un intervalo de rango por confianza entre el quinto y el décimo puesto. Que un modelo descargable de 27B se mezcle estadísticamente con sistemas de frontera en la nube al convertir capturas en interfaces es extraordinario. Estas pruebas no reproducen exactamente la configuración local de Qwen, pero son evidencia independiente de que la tabla de lanzamiento no describía un espejismo.

Pero un benchmark es un aparato de laboratorio, no una ley natural. SWE-bench Pro y DeepSWE se ejecutaron con Claude Code, contexto largo y parámetros definidos. Qwen corrigió tareas problemáticas de SWE-bench Pro y volvió a evaluar las bases. CoWorkBench y QwenSWEBench son internos. MathVision usa un prompt fijo y anotaciones corregidas; otras pruebas visuales dependen de graders y andamiajes concretos. No vuelve inútiles los números: aclara qué se midió, Qwen3.8 dentro de un sistema elegido con cuidado. Ollama, LM Studio, llama.cpp o tu propio agente pueden dar otro resultado.

El relato del hardware necesita la misma franqueza. Los shards BF16 oficiales suman unos 55,6 GB antes de la sobrecarga. El Q4_K_M de Unsloth ocupa 17,1 GB y su proyector visual 0,93 GB. Una descarga de 18 GB puede caber en una GPU de 24 GB, pero los seis gigabytes restantes no son un lujo vacío: deben alojar búferes y la caché KV que recuerda tokens anteriores. Cuanto mayor es el contexto, más memoria consume. Una tarjeta de 24 GB es un punto de partida creíble para un trabajo local útil, no una promesa de 262.144 tokens a máxima velocidad y con toda la precisión de caché.

Qwen ofrece controles poco habituales. La ventana nativa es de 262.144 tokens y documenta YaRN hacia un millón en vLLM, SGLang y TokenSpeed. El razonamiento viene activo, admite low, medium y xhigh, mientras que preserve_thinking puede conservar el contexto de razonamiento durante una conversación agéntica. También entrenó una cabeza de predicción de varios tokens que los sistemas de inferencia compatibles pueden aprovechar para acelerar la decodificación.

El ajuste de fábrica es el equivocado para muchos trabajos corrientes. Qwen usa xhigh por defecto, y Artificial Analysis registró 160 millones de tokens de salida en todo su índice, frente a una mediana de 43 millones para modelos abiertos comparables. En la prueba local de Simon Willison, un sencillo SVG de un pelícano consumió 22.276 tokens de razonamiento y 21 minutos; desactivar el pensamiento redujo la ejecución a 137 segundos. No es una regresión de calidad, sino una lección de uso: empieza con esfuerzo low o medium —o sin pensamiento para transformaciones sencillas— y eleva una tarea a xhigh solo cuando la búsqueda adicional merezca la espera. YaRN estático, el muestreo y la conservación del estado de razonamiento exigen la misma atención deliberada.

La primera prueba correcta es intencionadamente corriente. Carga un quant que pueda permanecer en memoria, elige una ventana con margen y encarga algo real con meta visible: reparar un test, extraer cifras de un informe privado o reproducir una interfaz desde una captura. Registra finalización, reintentos, velocidad y corrección humana. Después ejecuta Qwen3.6 o tu modelo actual bajo las mismas condiciones. Así mides tu taller, no el laboratorio de otro.

Por ahora, Qwen3.8-27B es el mejor valor por defecto en la intersección de privacidad, capacidad, multimodalidad y hardware alcanzable. Los modelos grandes pueden ser más inteligentes en zonas difíciles y los pequeños más rápidos. Qwen ocupa el centro útil: suficiente para trabajo serio, bastante pequeño para vivir bajo un escritorio y suficientemente abierto para que ese escritorio siga siendo solo tuyo.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • Un agente local multimodal de verdad: El mismo checkpoint lee texto, capturas, diagramas, documentos y vídeo, razona sobre ellos y puede llamar herramientas. No hace falta enviar un flujo privado a modelos separados de visión y código para investigar un fallo visual o extraer una tabla antes de modificar un programa.
  • Las mejoras del lanzamiento ya tienen respaldo independiente: Qwen3.8-27B pasa de los 53,5 de Qwen3.6-27B a 61,7 en SWE-bench Pro, de 63,4 a 73,0 en Terminal Bench 2.1 y de 13,3 a 42,2 en DeepSWE 1.1 en las pruebas de Qwen. Por separado, Artificial Analysis le da 52 en el Intelligence Index y 51 en el Agentic Index, resultados excepcionalmente sólidos para un modelo abierto de 27B.
  • Los 27B son pequeños de una forma útil: Los pesos Q4_K_M de Unsloth ocupan unos 17,1 GB y el proyector visual unos 0,93 GB. Eso hace realista una GPU de 24 GB o un equipo Apple Silicon bien equipado; el margen final depende del motor, la precisión de la caché y la longitud de contexto.
  • Contexto largo y controles de razonamiento muy completos: El contexto nativo es de 262.144 tokens y Qwen documenta YaRN hasta 1M para vLLM, SGLang y TokenSpeed. El razonamiento puede desactivarse, fijarse en low, medium o xhigh y conservarse entre turnos en bucles largos de agente. Estos controles importan porque xhigh es el valor predeterminado, no el punto de partida sensato para todas las tareas.
  • Licencia abierta y ecosistema listo muy pronto: El checkpoint oficial usa Apache 2.0. Qwen documenta vLLM, SGLang y TokenSpeed; Ollama ya ofrece qwen3.8:27b de 18 GB y Unsloth publica GGUF desde unos 9 hasta 31,5 GB.

Limitaciones honestas

  • La confirmación independiente es amplia, no una reproducción de cada afirmación: Artificial Analysis y Arena ya respaldan el relato sobre inteligencia general, capacidad agéntica y programación visual. Qwen sigue siendo quien ejecutó la mayoría de comparaciones principales, mezclando pruebas públicas con QwenSWEBench, CoWorkBench y RecreationBench, que son internas. SWE-bench Pro y DeepSWE usan un arnés de Claude Code, así que miden un sistema de modelo más andamiaje, no los pesos desnudos en cualquier aplicación local.
  • Veinticuatro gigabytes no compran todo el contexto de 262K: Los pesos son solo la primera maleta. El proyector visual, los búferes y una caché KV creciente también consumen memoria. Una tarjeta de 24 GB ejecuta 4 bits, pero los prompts muy largos exigen una caché menor o cuantizada, descarga parcial a CPU o más memoria.
  • Cuantizar cambia aquello que se mide: La tabla de Qwen no demuestra que todo GGUF de 4 bits conserve igual el razonamiento, la visión y el uso de herramientas. La pérdida puede ser pequeña o depender de la tarea, pero producción debe probar exactamente el quant y el contexto previstos.
  • El valor predeterminado puede convertir un encargo rápido en una larga meditación: Qwen usa xhigh por defecto. La sencilla prueba SVG de Simon Willison tardó 21 minutos y consumió 22.276 tokens de razonamiento, frente a 137 segundos con el pensamiento desactivado. Empieza con low o medium para el trabajo interactivo, reserva xhigh para los problemas realmente difíciles y recuerda que el muestreo, los esquemas de herramientas, las plantillas de chat y YaRN estático también afectan al resultado.
03

Resumen de Benchmarks

Reparación de repositorios — SWE-bench Pro: 61,7

Qwen declara 61,7 frente a 53,5 de Qwen3.6-27B. Los modelos se probaron con el arnés de Claude Code, temperatura 1,0, top-p 0,95, contexto 256K y un conjunto refinado donde se corrigieron tareas problemáticas.

Agente de terminal — Terminal Bench 2.1: 73,0

Supone 9,6 puntos más que Qwen3.6-27B en la tabla de Qwen. Es una señal fuerte para el trabajo de terminal por etapas, aunque la velocidad y el éxito locales siguen dependiendo del andamiaje del agente y de las herramientas disponibles.

Uso del ordenador — OSWorld-Verified: 84,3

La mayor sorpresa práctica: este checkpoint compacto supera a todos los comparados en la tabla de Qwen, incluido Opus 4.6 Max con 72,7. La reproducción independiente es especialmente importante porque estos resultados son sensibles al arnés que rodea al modelo.

Huella local — Q4_K_M más proyector visual: unos 18 GB

Los metadatos del repositorio listan un GGUF Q4_K_M de 17,1 GB y un proyector visual BF16 de unos 0,93 GB. Los archivos caben en hardware de 24 GB; la memoria restante decide el contexto utilizable y la concurrencia.

Índice compuesto independiente — Artificial Analysis Intelligence Index: 52

La configuración xhigh obtiene 52, igual que GPT-5.6 Luna con esfuerzo max en la captura citada, y ocupa el primer puesto de la categoría comparativa de pesos abiertos entre 4B y 40B de Artificial Analysis. Usó 160 millones de tokens de salida en todo el índice, frente a una mediana de 43 millones, por lo que el resultado también documenta una verbosidad excepcional.

Programación visual — Arena Image-to-WebDev: #7, puntuación 1574

El 25 de agosto, el modelo de 27B ocupaba el séptimo puesto entre 44 sistemas, con 1.686 votos y un intervalo de rango de 5–10; estadísticamente se mezclaba con modelos mucho mayores y más caros. Arena aporta evidencia de preferencias, no un benchmark controlado de una cuantización local, pero respalda de forma independiente la fuerza práctica del modelo al combinar visión y programación.

04

El Veredicto

Qwen3.8-27B sigue siendo nuestra recomendación #1 de IA Local / Privada porque ofrece el conjunto más útil para una persona: programación y agentes serios, imagen y vídeo nativos, contexto largo, libertad Apache 2.0 y un tamaño cuantizado que cabe en una GPU de consumo potente. Artificial Analysis y Arena hacen que esa posición dependa menos de las tablas de lanzamiento de Qwen. No supera a todos los modelos mayores, y las pruebas independientes mediante API no demuestran que cada versión Q4 local se comporte igual. El 9,2 es una recomendación sólida, pero sensible a la configuración: empieza por debajo de xhigh, prueba el quant, las herramientas y el contexto exactos que desplegarás y mantén revisión humana en acciones importantes.

05

Preguntas frecuentes