5 de septiembre de 2026 · Z.ai
Z.ai lanza GLM-5.3-Flash: modelo multimodal abierto de 320B con contexto de 1M tokens
Mi opinión: Z.ai publicó GLM-5.3-Flash, el primer modelo multimodal de la familia GLM-5: 320 mil millones de parámetros en arquitectura MoE que activa solo 18 mil millones a la vez, con ventana de contexto de un millón de tokens, soporte para texto, imagen y video, y pesos disponibles bajo licencia MIT.
Para quienes construyen proyectos o aplican IA en el trabajo, un modelo de este calibre a $0.15 por millón de tokens de entrada (con precio de lanzamiento de $0.075 hasta el 9 de septiembre) es una opción real para flujos de trabajo que antes costaban diez veces más. Combinado con el contexto largo y la multimodalidad, es útil para analizar documentos extensos, procesar video o correr agentes que procesan grandes volúmenes de información de forma repetida.
Lo que me parece más relevante de este lanzamiento no es solo el precio: es que los modelos open source de frontera ya son multimodales, baratos y descargables. Eso cambia el cálculo para cualquier proyecto donde el costo de API o la dependencia de un solo proveedor era el freno.
Si tienes un flujo de trabajo que hoy limitas por el costo de la API o por no querer depender de un solo proveedor, ¿cómo lo enfocarías con un modelo de estas características corriendo en tu propio servidor?
¿Quieres usar estas herramientas? Mira las reseñas sin filtro o vuelve a las noticias.