Al hablar de la IA local, la conversación suele girar en torno a los compromisos. O consigues un modelo enorme que requiere una granja de servidores para funcionar, o un modelo pequeño que lucha por mantener el contexto a lo largo de una compleja sesión de programación. DeepSeek-V4-Flash-0731 rompe esa dicotomía.
Lanzado como una actualización pura de post-entrenamiento el 31 de julio de 2026, Flash-0731 comparte exactamente la misma arquitectura MoE de 284B totales y 13B de parámetros activos que su anterior versión preliminar. Sin embargo, las capacidades desbloqueadas en esta actualización son asombrosas. En Terminal Bench 2.1, se dispara a 82.7, casi igualando al peso pesado de código cerrado Opus 4.8. En DeepSWE, salta de un modesto 7.3 a un dominante 54.4. Esto demuestra que no se necesita un billón de parámetros para construir un agente de nivel de frontera; solo hay que enseñar a un modelo altamente eficiente exactamente cómo usar herramientas, navegar por terminales y recuperarse de sus propios errores.
La magia del Flash-0731 reside en su dispersión (sparsity). Debido a que solo 13B de parámetros están activos durante la inferencia, requiere mucho menos ancho de banda de memoria que los modelos densos masivos o MoEs más pesados como el GLM-5.2. Cuando se cuantiza cuidadosamente usando los formatos dinámicos GGUF de Unsloth, la versión de 3 bits se exprime en aproximadamente 103 GB de RAM. Esto cruza un umbral crítico: hace que la programación autónoma de nivel de frontera sea accesible para los desarrolladores individuales que operan hardware de memoria unificada de 128 GB, en lugar de solo equipos empresariales con clústeres de múltiples GPUs.
No es un modelo perfecto. Es completamente ciego a las imágenes, y si lo pruebas en trivias de conocimiento general, se queda un poco por detrás del GLM-5.2, más pesado. Pero para su caso de uso previsto (actuar como un agente de codificación implacable y rentable que avanza sin parar a través de tu repositorio local) es inigualable.
Cuando se tiene en cuenta la generosa licencia MIT, la ventana de contexto de tokens de 1M y el soporte de decodificación especulativa de DSpark, el DeepSeek-V4-Flash-0731 no es solo una alternativa a los modelos más grandes; es un plano para el futuro de la IA local eficiente. Ofrece la inteligencia que necesitas, exactamente donde la necesitas, sin exigir una supercomputadora a cambio.