Puesto #7 Programación — IA que Escribe Software de Producción
Z.ai (Zhipu AI)

GLM-5.3-Flash

Programación y trabajo agéntico cerca de la frontera a precios excepcionalmente bajos, con visión nativa y un contexto de 1M. Aquí «Flash» significa eficiente y barato, no pequeño ni especialmente rápido.

Actualizado 29 de agosto de 2026 Multimodal CodingOpen WeightsMIT
Ideal para

Programación y trabajo agéntico cerca de la frontera a precios excepcionalmente bajos, con visión nativa y un contexto de 1M. Aquí «Flash» significa eficiente y barato, no pequeño ni especialmente rápido.

Por qué gana

Artificial Analysis otorga a GLM-5.3-Flash un Intelligence Index de 57 por aproximadamente $0.09 por tarea del índice a precio de lista. Terminal-Bench 2.1 ronda 84,3, mientras que los pesos MIT y la entrada multimodal permiten programar a partir de capturas de pantalla.

Ten en cuenta

El modelo queda por detrás de los programadores cerrados más potentes y del GLM-5.3 insignia en trabajos difíciles. La API de Z.ai genera cerca de 50 tokens por segundo, el razonamiento siempre está activo, la salida puede ser verbosa y la mayoría de las filas detalladas del lanzamiento proceden de pruebas del proveedor.

01

Lo que realmente es

Imagina a dos ingenieros. Uno resuelve el rompecabezas más difícil con una frecuencia ligeramente mayor. El otro es casi igual de capaz, puede mirar la pantalla y cuesta muchísimo menos, de modo que puedes permitirte dejarlo buscar, probar y verificar durante toda la tarde. GLM-5.3-Flash es el segundo ingeniero. Su ventaja no es un trofeo a la inteligencia absoluta, sino la cantidad de trabajo útil que puede sostener un presupuesto.

El nombre invita a una suposición equivocada. En la API propia de Z.ai, Artificial Analysis mide alrededor de cincuenta tokens de salida por segundo, menos que el GLM-5.3 insignia. «Flash» describe un nivel rediseñado de eficiencia y precios. El modelo tiene 320.000 millones de parámetros totales, pero activa unos 18.000 millones para cada token, combinando atención dispersa y lineal para reducir el coste de los contextos largos. Un restaurante puede servir cada comida con un equipo pequeño y aun así necesitar todo el edificio.

Esa arquitectura admite un contexto de un millón de tokens y entrada multimodal nativa. En programación, la visión no es un adorno. El modelo puede inspeccionar un diseño roto, leer el diálogo de error de una captura, comparar un gráfico con el componente que lo produjo o utilizar fotogramas de vídeo para entender una secuencia de interfaz. El GLM-5.3 insignia no puede hacerlo sin un paso de visión externo.

La evidencia independiente es alentadora. Artificial Analysis otorga a Flash un 57 en su Intelligence Index actual y mide aproximadamente 84,3 en Terminal-Bench 2.1. Z.ai comunica 63,4 en DeepSWE, 78,4 en Toolathlon Verified y 48,8 en AutomationBench. Estas últimas filas describen clases reales de trabajo, pero la mayoría siguen siendo pruebas del proveedor o solo parcialmente inspeccionables. Una buena reseña las utiliza como pistas con etiqueta, no como ladrillos para levantar un monumento a la victoria.

La economía resulta excepcionalmente clara. Las tarifas estándar de la API son de quince centavos por millón de tokens de entrada, tres centavos por entrada en caché y cincuenta centavos por millón de tokens de salida. Hasta el 9 de septiembre de 2026 a las 24:00 UTC+8, Z.ai reduce esas tarifas a la mitad. Artificial Analysis estima unos nueve centavos por tarea del Intelligence Index al precio de lista, y Z.ai cita alrededor de 4,5 centavos durante la promoción. El coste promocional es temporal; la capacidad no.

La adopción en OpenRouter fue enorme durante la vista previa gratuita Ox Alpha, pero el volumen de tokens no es una encuesta de satisfacción. El acceso gratis, los prompts de un millón de tokens y el razonamiento verboso inflan el contador. La conclusión justa es que los desarrolladores lo probaron a una escala extraordinaria y la vía de pago comenzó con fuerza, no que billones de tokens demuestren que todos los usuarios lo preferían.

El razonamiento no se puede desactivar. Las aplicaciones eligen esfuerzo low, high o max, y max se utiliza para reproducir los benchmarks. El modelo puede gastar muchos tokens pensando, y una idea equivocada pero persistente puede convertirse en un bucle caro incluso con precios unitarios bajos. Establece presupuestos, detecta llamadas repetidas a herramientas, exige pruebas y reserva el esfuerzo low para transformaciones corrientes.

GLM-5.3-Flash es, por tanto, un especialista en valor con un alcance cercano a la frontera. Ponlo en el banco de trabajo repetitivo: buscar en el repositorio, inspeccionar la captura, implementar la corrección rutinaria, ejecutar la prueba y explicar el resultado. Mantén disponible un modelo más potente para ese problema poco frecuente en el que resolver un caso adicional importa más que el coste de cien casos corrientes. Esa división del trabajo es más útil que fingir que cada lanzamiento debe destronar a un rey.

02

Puntos fuertes y límites honestos

Puntos fuertes

  • El coste por tarea resuelta es el verdadero titular: El precio de lista es de $0.15/M de entrada y $0.50/M de salida, con una promoción temporal del 50 % hasta el 9 de septiembre. Así, los bucles largos de agentes resultan lo bastante asequibles para utilizar el modelo como trabajador habitual y no solo en ocasiones especiales.
  • La visión forma parte del bucle de programación: El modelo puede leer capturas, diagramas, documentos y vídeo como contexto. Los agentes de frontend y soporte pueden relacionar lo que muestra la interfaz con lo que contiene el repositorio.
  • Las pruebas independientes respaldan una capacidad cercana a la frontera: Artificial Analysis lo puntúa con 57 en Inteligencia y registra de forma independiente aproximadamente 84,3 en Terminal-Bench 2.1, cerca del resultado publicado por Z.ai.
  • Los pesos MIT reducen las fricciones del despliegue: Los equipos pueden inspeccionar, modificar, alojar y comercializar el modelo bajo una licencia permisiva estándar, con vías de servicio mediante vLLM, SGLang, TokenSpeed y otras opciones.

Limitaciones honestas

  • Flash es un nivel de precio, no un cronómetro: En las pruebas de Artificial Analysis, el endpoint propio de Z.ai produce aproximadamente 50 tokens por segundo. Existen proveedores externos más rápidos, pero la elección del proveedor pasa a formar parte del producto.
  • Es más barato que el modelo insignia, no mejor: GLM-5.3 obtiene puntuaciones superiores en inteligencia general y baterías difíciles de largo recorrido. Flash gana Toolathlon y algunas filas de automatización en la tabla de Z.ai, no toda la comparación.
  • El razonamiento es obligatorio y verboso: Hay niveles low, high y max de esfuerzo, con max como opción predeterminada. Incluso una edición rutinaria puede activar una larga búsqueda interna, por lo que las aplicaciones necesitan presupuestos y límites de bucles.
  • La confianza en los benchmarks detallados varía: DeepSWE, Toolathlon, AutomationBench, HLE con herramientas y las filas de visión son en su mayoría pruebas de Z.ai o solo se pueden inspeccionar parcialmente de forma independiente. Hay que atribuir cada cifra en lugar de llamar consenso a la tabla de lanzamiento.
03

Resumen de Benchmarks

Artificial Analysis Intelligence Index — 57

Las pruebas agregadas independientes sitúan Flash cerca de la inteligencia de clase GPT-5.6 Terra por una fracción del coste de tokens, aunque todavía por debajo de Opus 5 y del GLM-5.3 insignia.

Terminal-Bench 2.1 — aproximadamente 84,3

Es una de las señales más sólidas sobre una tarea concreta respaldadas de forma independiente. Su ligera ventaja numérica sobre una ejecución del modelo insignia configurada por separado no establece una clasificación de calidad intrínseca: difieren el entorno de evaluación y el muestreo. La versión 2.1 no debe mezclarse con Terminal-Bench 3.0, que es mucho más difícil.

DeepSWE v1.1 — 63,4 (prueba de Z.ai)

Supone una gran mejora sobre GLM-5.2 y una señal sólida para agentes de repositorio, pero queda por debajo de GPT-5.6 Sol en la tabla citada y todavía no se ha reproducido de forma independiente.

Toolathlon Verified — 78,4 (servicio oficial / informe de Z.ai)

Flash lidera la comparación de Z.ai en esta batería de uso de herramientas del mundo real. La media comunicada abarca tres ejecuciones, pero no se encontró un artefacto independiente separado.

GDPval-AA v2 — grupo líder, Elo en vivo

Las capturas de finales de agosto colocan Flash y GLM insignia en una zona con solapamiento estadístico, por detrás de las configuraciones más potentes de Opus. El Elo en vivo siempre debe fecharse.

04

El Veredicto

GLM-5.3-Flash entra en Programación en el puesto #7 con un 9,2, justo detrás del GLM-5.3 insignia. No es el modelo que deba coronarse por una sola tabla; es el modelo que conviene desplegar cuando miles de pasos útiles de un agente importan más que ganar los últimos puntos de un examen de frontera. Úsalo para búsquedas masivas en repositorios, correcciones rutinarias, frontend guiado por capturas, llamadas a herramientas y bucles de verificación. Escala los trabajos de texto más difíciles al GLM-5.3 insignia o a un modelo cerrado líder, y mide la velocidad del proveedor antes de prometer que «Flash» se sentirá rápido.

05

Preguntas frecuentes