Puesto #1 IA Local / Privada — Tu Cerebro en tu Hardware
Alibaba (Qwen Team)

Qwen3.8 — 27B

Qwen3.8-27B es uno de esos raros modelos locales cuyos compromisos encajan con el hardware que la gente realmente tiene: un checkpoint denso de 27B para texto, imágenes, vídeo, programación y agentes con herramientas. Una versión de 4 bits cabe en una GPU de 24 GB, y Apache 2.0 permite mantener el trabajo privado y usarlo comercialmente.

Actualizado 15 de agosto de 2026 Open WeightsApache 2.027B Dense
Ideal para

Qwen3.8-27B es uno de esos raros modelos locales cuyos compromisos encajan con el hardware que la gente realmente tiene: un checkpoint denso de 27B para texto, imágenes, vídeo, programación y agentes con herramientas. Una versión de 4 bits cabe en una GPU de 24 GB, y Apache 2.0 permite mantener el trabajo privado y usarlo comercialmente.

Por qué gana

Qwen declara 61,7 en SWE-bench Pro, 73,0 en Terminal Bench 2.1, 42,2 en DeepSWE 1.1, 84,3 en OSWorld-Verified y 70,7 en CoWorkBench. Ofrece 262.144 tokens de contexto nativo, YaRN opcional hacia 1M, esfuerzo de razonamiento configurable, conservación del razonamiento entre turnos y comprensión nativa de imagen y vídeo.

Ten en cuenta

Son pruebas del día del lanzamiento, no una verdad asentada. Casi todas las cifras principales vienen de la tabla de Qwen; algunas usan el arnés de Claude Code, tareas corregidas, prompts especiales o pruebas internas. El paquete Q4_K_M habitual ronda 18 GB con su proyector visual, pero la sobrecarga y la caché KV aún limitan el contexto que cabe en una tarjeta de 24 GB.

01

Lo que realmente es

Imagina que eliges un taller, no un solo martillo. Un modelo local debe entrar por la puerta, dejar espacio en la mesa, entender el material y usar herramientas sin sacar datos privados fuera. Qwen3.8-27B resulta atractivo porque reúne esas condiciones en un checkpoint. Es un modelo denso de visión y lenguaje con 27.000 millones de parámetros sobre la base híbrida de Qwen3.5: repite tres capas Gated DeltaNet y una capa de atención completa. La atención lineal ayuda a la eficiencia; la atención completa periódica mantiene conexiones entre detalles lejanos.

Aquí “multimodal” no es un botón decorativo. Qwen lo entrena y distribuye para texto, imágenes y vídeo. Un agente de programación local puede inspeccionar una captura, leer un diálogo de error, compararlo con el código y operar herramientas sin mandar antes la imagen a un servicio de visión en la nube. La ficha también habla de documentos, gráficos, navegadores, móviles y vídeos de una hora. Por eso se parece más a un banco de trabajo privado que a un autocompletado especializado.

Las cifras iniciales explican el entusiasmo: 61,7 en SWE-bench Pro, 73,0 en Terminal Bench 2.1, 42,2 en DeepSWE 1.1 y 90,3 en LiveCodeBench v6. Para agentes multimodales, Qwen declara 84,3 en OSWorld-Verified, 64,8 en WebArena-Verified y 70,7 en CoWorkBench. Frente a Qwen3.6-27B, la mejora aparece en reparación de repositorios, terminal, trabajo de oficina y control del ordenador. Esa amplitud dice más que un récord aislado.

Pero un benchmark es un aparato de laboratorio, no una ley natural. SWE-bench Pro y DeepSWE se ejecutaron con Claude Code, contexto largo y parámetros definidos. Qwen corrigió tareas problemáticas de SWE-bench Pro y volvió a evaluar las bases. CoWorkBench y QwenSWEBench son internos. MathVision usa un prompt fijo y anotaciones corregidas; otras pruebas visuales dependen de graders y andamiajes concretos. No vuelve inútiles los números: aclara qué se midió, Qwen3.8 dentro de un sistema elegido con cuidado. Ollama, LM Studio, llama.cpp o tu propio agente pueden dar otro resultado.

El relato del hardware necesita la misma franqueza. Los shards BF16 oficiales suman unos 55,6 GB antes de la sobrecarga. El Q4_K_M de Unsloth ocupa 17,1 GB y su proyector visual 0,93 GB. Unos 18 GB caben en una GPU de 24 GB, pero los seis restantes deben alojar búferes y la caché KV que recuerda tokens anteriores. Cuanto mayor es el contexto, más memoria consume. Una tarjeta de 24 GB es un punto de partida creíble, no una promesa de 262.144 tokens a máxima velocidad.

Qwen ofrece controles poco habituales. La ventana nativa es de 262.144 tokens y documenta YaRN hacia un millón en vLLM, SGLang y TokenSpeed. El razonamiento viene activo, admite low, medium y xhigh y puede conservar contexto de pensamiento entre turnos. También entrenó una cabeza de predicción de varios tokens que los motores compatibles pueden aprovechar para acelerar la decodificación. Son controles, no magia: YaRN estático puede dañar textos cortos, y un razonamiento menor puede provocar reintentos que borren el ahorro.

La primera prueba correcta es intencionadamente corriente. Carga un quant que pueda permanecer en memoria, elige una ventana con margen y encarga algo real con meta visible: reparar un test, extraer cifras de un informe privado o reproducir una interfaz desde una captura. Registra finalización, reintentos, velocidad y corrección humana. Después ejecuta Qwen3.6 o tu modelo actual bajo las mismas condiciones. Así mides tu taller, no el laboratorio de otro.

Por ahora, Qwen3.8-27B es el mejor valor por defecto en la intersección de privacidad, capacidad, multimodalidad y hardware alcanzable. Los modelos grandes pueden ser más inteligentes en zonas difíciles y los pequeños más rápidos. Qwen ocupa el centro útil: suficiente para trabajo serio, bastante pequeño para vivir bajo un escritorio y suficientemente abierto para que ese escritorio siga siendo solo tuyo.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • Un agente local multimodal de verdad: El mismo checkpoint lee texto, capturas, diagramas, documentos y vídeo, razona sobre ellos y puede llamar herramientas. No hace falta enviar un flujo privado a modelos separados de visión y código para investigar un fallo visual o extraer una tabla antes de modificar un programa.
  • Grandes avances frente a la generación anterior en las pruebas de Qwen: Qwen3.8-27B pasa de 53,5 a 61,7 en SWE-bench Pro, de 63,4 a 73,0 en Terminal Bench 2.1 y de 13,3 a 42,2 en DeepSWE 1.1 frente a Qwen3.6-27B. El arnés importa, pero la mejora aparece en varios tipos de trabajo de software.
  • Los 27B son pequeños de una forma útil: Los pesos Q4_K_M de Unsloth ocupan unos 17,1 GB y el proyector visual unos 0,93 GB. Eso hace realista una GPU de 24 GB o un equipo Apple Silicon bien equipado; el margen final depende del motor, la precisión de la caché y la longitud de contexto.
  • Contexto largo y controles de razonamiento muy completos: El contexto nativo es de 262.144 tokens y Qwen documenta YaRN hasta 1M para vLLM, SGLang y TokenSpeed. El razonamiento puede desactivarse, fijarse en low, medium o xhigh y conservarse entre turnos en bucles largos de agente.
  • Licencia abierta y ecosistema listo muy pronto: El checkpoint oficial usa Apache 2.0. Qwen documenta vLLM, SGLang y TokenSpeed; Ollama ya ofrece qwen3.8:27b de 18 GB y Unsloth publica GGUF desde unos 9 hasta 31,5 GB.

Limitaciones honestas

  • Las cifras proceden principalmente del proveedor: Qwen ejecutó la mayoría de comparaciones y mezcla pruebas públicas con QwenSWEBench, CoWorkBench y RecreationBench, que son internas. SWE-bench Pro y DeepSWE usan Claude Code con la configuración declarada por Qwen, así que miden un sistema de modelo más arnés, no los pesos desnudos en cualquier aplicación local.
  • Veinticuatro gigabytes no compran todo el contexto de 262K: Los pesos son solo la primera maleta. El proyector visual, los búferes y una caché KV creciente también consumen memoria. Una tarjeta de 24 GB ejecuta 4 bits, pero los prompts muy largos exigen una caché menor o cuantizada, descarga parcial a CPU o más memoria.
  • Cuantizar cambia aquello que se mide: La tabla de Qwen no demuestra que todo GGUF de 4 bits conserve igual el razonamiento, la visión y el uso de herramientas. La pérdida puede ser pequeña o depender de la tarea, pero producción debe probar exactamente el quant y el contexto previstos.
  • Las integraciones tempranas requieren cuidados propios de Qwen: El razonamiento viene activo, Qwen recomienda muestreos distintos para modo razonado y directo, y YaRN estático puede perjudicar textos cortos. Esquemas de herramientas, límites de salida y plantilla de chat forman parte del producto.
03

Resumen de Benchmarks

Reparación de repositorios — SWE-bench Pro: 61,7

Qwen declara 61,7 frente a 53,5 de Qwen3.6-27B. Los modelos se probaron con Claude Code, temperatura 1,0, top-p 0,95, contexto 256K y un conjunto refinado donde se corrigieron tareas problemáticas.

Agente de terminal — Terminal Bench 2.1: 73,0

Supone 9,6 puntos más que Qwen3.6-27B en la tabla de Qwen. Es una señal fuerte para trabajo de terminal por etapas, aunque velocidad y éxito locales siguen dependiendo del arnés y de las herramientas disponibles.

Uso del ordenador — OSWorld-Verified: 84,3

La sorpresa práctica: este checkpoint compacto supera a todos los comparados por Qwen, incluido Opus4.6 Max con 72,7. La reproducción independiente es especialmente importante porque estos resultados son sensibles al arnés.

Huella local — Q4_K_M más proyector visual: unos 18 GB

Los metadatos listan un GGUF Q4_K_M de 17,1 GB y un proyector visual BF16 de unos 0,93 GB. Los archivos caben en hardware de 24 GB; la memoria restante decide el contexto y la concurrencia.

04

El Veredicto

Qwen3.8-27B se convierte en nuestro #1 de IA Local / Privada porque ofrece el conjunto más útil para una persona: programación y agentes serios, imagen y vídeo nativos, contexto largo, libertad Apache 2.0 y un tamaño cuantizado que cabe en una GPU de consumo potente. No gana a todos los modelos grandes—DeepSeek-V4-Flash-0731 lidera Terminal Bench y DeepSWE en la propia tabla de Qwen—pero los quants útiles de DeepSeek necesitan alrededor de 100 GB, no 18 GB. Esa diferencia de acceso pesa en una categoría local. El 9,2 es provisional: prueba el quant, las herramientas y los prompts exactos, conserva revisión humana en acciones importantes y revisa el ranking cuando maduren las réplicas independientes.

05

Preguntas frecuentes