⏱️ Lectura: 9 min
Z.ai publicó hoy los pesos de GLM-5.3, la actualización directa de GLM-5.2, el modelo que hasta ahora era la punta de lanza de la compañía en pesos abiertos. El lanzamiento se suma a la seguidilla de modelos chinos abiertos que en 2026 compiten cabeza a cabeza con los laboratorios occidentales.
📑 En este artículo
La novedad importa porque GLM-5.2 ya había demostrado que un modelo de esa escala podía correr en hardware de consumo gracias a cuantización agresiva. GLM-5.3 hereda esa filosofía y la extiende, según el anuncio publicado en el blog oficial de Z.ai.
TL;DR
- Z.ai lanzó GLM-5.3 el 14 de agosto de 2026 como sucesor directo de GLM-5.2.
- Los pesos del modelo están disponibles públicamente para descarga y uso local.
- Mantiene la arquitectura Mixture-of-Experts (MoE) que caracterizó a la familia GLM-5.
- Expone una API compatible con el formato de OpenAI, lo que simplifica migrar integraciones existentes.
- Se puede servir localmente con vLLM u Ollama en Linux, macOS y Windows.
- GLM-5.2, su predecesor, ya corría en local gracias a cuantización agresiva.
- Z.ai es la marca internacional de Zhipu AI, competidor directo de DeepSeek, Moonshot AI (Kimi) y Alibaba (Qwen).
Qué pasó
El anuncio se publicó en el blog oficial de Z.ai, donde la compañía presentó GLM-5.3 como la siguiente iteración de su línea insignia de modelos abiertos. La empresa, antes conocida como Zhipu AI y con sede en Beijing, viene publicando actualizaciones de la serie GLM a un ritmo trimestral desde 2025.
GLM-5.3 llega apenas unas semanas después de que la comunidad terminara de asimilar GLM-5.2, que ya tenía presencia destacada en el segmento de pesos abiertos. La velocidad de iteración es, en sí misma, parte de la estrategia: Z.ai compite no solo en capacidad sino en frecuencia de lanzamientos frente a DeepSeek y Moonshot AI.
Contexto e historia
La familia GLM nació como ChatGLM, un proyecto académico de la Universidad Tsinghua que luego se convirtió en el producto comercial de Zhipu AI. La compañía se rebautizó como Z.ai para su expansión internacional, separando la marca china (Zhipu) de la marca global orientada a desarrolladores fuera de China.
Desde GLM-4 hasta GLM-5, cada generación amplió el contexto disponible, sumó capacidades agénticas (uso de herramientas, ejecución de código, navegación web) y redujo la brecha con los modelos cerrados en benchmarks de programación. Parte del atractivo frente a modelos como Llama o Mistral es la licencia: la familia GLM suele distribuirse con términos permisivos que facilitan uso comercial sin fricciones legales adicionales.
La siguiente tabla resume cómo se posicionan las dos últimas versiones:
| Aspecto | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Arquitectura | Mixture-of-Experts (MoE) | Mixture-of-Experts (MoE), misma familia |
| Distribución | Pesos abiertos en Hugging Face | Pesos abiertos en Hugging Face |
| Acceso API | Endpoint propio de Z.ai | Endpoint propio de Z.ai, compatible con OpenAI |
| Cuándo usarlo | Despliegues ya validados, cargas estables | Proyectos nuevos que quieran las últimas correcciones |
| Limitación | Ya no recibe las últimas mejoras | Menor tiempo de adopción probada en producción |
GLM-5.3: detalles técnicos y rendimiento
GLM-5.3 mantiene el enfoque Mixture-of-Experts: en lugar de activar todos los parámetros del modelo en cada pasada, un router selecciona un subconjunto de “expertos” para cada token. Esto permite modelos con un conteo total de parámetros muy grande sin que el costo de inferencia crezca en la misma proporción, algo clave para que un modelo de esta escala sea viable fuera de un datacenter.
flowchart TD
A["Peticion del usuario"] --> B["Router de GLM-5.3"]
B --> C["Subconjunto de expertos activos"]
C --> D["Capas de atencion"]
D --> E["Respuesta generada"]
subgraph MoE
B
C
end
Para verificar cuántos parámetros totales y activos tiene la descarga que instalaste, el dato exacto está en el config.json del repositorio del modelo: los campos num_experts, num_experts_per_tok y hidden_size definen la forma real del router. No hace falta confiar en cifras de marketing: ese archivo es la fuente de verdad, y la comunidad suele publicar cuantizaciones GGUF o AWQ derivadas del mismo checkpoint a los pocos días del lanzamiento.
💡 Tip: corré python -c "import json;print(json.load(open('config.json')))" dentro de la carpeta del modelo descargado para inspeccionar la configuración real del router antes de desplegarlo.
Sobre benchmarks: Z.ai suele publicar sus propios números de SWE-bench, LiveCodeBench y similares en el blog de lanzamiento. Como esos resultados varían según el harness y la versión del benchmark usada, la forma más confiable de comparar GLM-5.3 contra otros modelos abiertos es correr vos mismo el benchmark que te importa (por ejemplo SWE-bench) contra tu propio caso de uso, en lugar de tomar un número aislado de un anuncio.
Cómo empezar
Como el resto de la familia GLM, los pesos de GLM-5.3 se descargan desde Hugging Face. El primer paso es igual en cualquier sistema operativo: instalar el cliente de Hugging Face y traer el repositorio del modelo.
# Linux / macOS
pip install -U "huggingface_hub[cli]"
huggingface-cli download zai-org/GLM-5.3 --local-dir ./glm-5.3
# Windows (PowerShell)
pip install -U "huggingface_hub[cli]"
huggingface-cli download zai-org/GLM-5.3 --local-dir .\glm-5.3
Con los pesos en disco, la forma más simple de levantar un endpoint compatible con la API de OpenAI es con vLLM. La variable VLLM_API_KEY define la clave que vas a exigir a los clientes, y --served-model-name es el nombre que después usás en el campo model de cada request:
export VLLM_API_KEY="tu-clave-local"
vllm serve zai-org/GLM-5.3 \
--tensor-parallel-size 8 \
--served-model-name glm-5.3 \
--port 8000
Una vez arriba, cualquier cliente que hable el protocolo de OpenAI puede apuntar a ese endpoint cambiando solo la URL base:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer tu-clave-local" \
-d '{
"model": "glm-5.3",
"messages": [{"role": "user", "content": "Explicame que es un router MoE"}]
}'
Si no tenés GPUs suficientes para el modelo completo, Ollama facilita correr versiones cuantizadas en una laptop; el comando es el mismo en Windows, macOS y Linux una vez instalado el cliente: ollama run glm-5.3.
Impacto y análisis
Cada nuevo lanzamiento de GLM presiona el precio de los modelos cerrados. Cuando un modelo abierto se acerca en calidad a las opciones propietarias, los proveedores que cobran por token pierden margen para justificar tarifas altas frente a alternativas que un equipo puede alojar por su cuenta. Eso ya se vio con DeepSeek V4 y con Kimi K3 en meses anteriores.
Para equipos de desarrollo en Latinoamérica, la disponibilidad de pesos abiertos como GLM-5.3 significa poder correr inferencia sin depender de un proveedor extranjero ni de la latencia de una API remota, algo relevante para aplicaciones que manejan datos sensibles o que necesitan control total sobre el modelo desplegado. Además, como el endpoint es compatible con el formato de OpenAI, frameworks como LangChain o LlamaIndex funcionan sin adaptadores especiales: basta con apuntar el cliente al endpoint propio.
📌 Nota: alojar un modelo de este tamaño en producción implica costo de GPU real; antes de migrar, calculá el punto de equilibrio entre pagar por token en una API gestionada y mantener infraestructura propia.
Qué sigue
Es habitual que, tras el lanzamiento del modelo base, Z.ai publique variantes más livianas (pensadas para correr en una sola GPU) semanas después, siguiendo el patrón que ya usaron DeepSeek y Moonshot AI con sus propias familias. También es esperable que la comunidad publique cuantizaciones de terceros y ajustes con LoRA sobre GLM-5.3 en los primeros días tras el lanzamiento.
El otro punto a seguir es si GLM-5.3 aparece pronto en rankings independientes como el de Artificial Analysis, donde GLM-5.2 ya tenía presencia; eso permitirá comparar la mejora real contra la generación anterior con una metodología consistente en lugar de depender solo de los números que publique el propio fabricante.
📖 Resumen en Telegram: Ver resumen
Probalo vos: corré huggingface-cli download zai-org/GLM-5.3 hoy mismo o leé el anuncio original en el blog de Z.ai para ver el modelo en acción.
Preguntas frecuentes
¿Qué es GLM-5.3?
Es la última versión de la familia GLM de Z.ai, un modelo de lenguaje con arquitectura Mixture-of-Experts distribuido con pesos abiertos, sucesor directo de GLM-5.2.
¿Es gratuito?
Los pesos son de descarga libre para correrlo vos mismo, aunque necesitás la infraestructura para alojarlo. Z.ai también ofrece un endpoint de API propio, que normalmente se cobra por token, igual que otros proveedores de modelos abiertos como DeepSeek o Moonshot AI.
¿En qué se diferencia de GLM-5.2?
Ambos comparten la arquitectura MoE y el enfoque de pesos abiertos. GLM-5.3 es la iteración más reciente e incorpora las correcciones y ajustes posteriores al lanzamiento de GLM-5.2; los detalles finos de cada cambio están en el anuncio oficial del blog de Z.ai.
¿Qué hardware necesito para correrlo?
Depende de la variante y la cuantización elegida. Para el modelo completo hacen falta varias GPUs con suficiente memoria combinada; para uso local en una laptop conviene una cuantización más agresiva o una versión reducida servida con Ollama.
¿Es compatible con la API de OpenAI?
Sí, tanto el endpoint alojado por Z.ai como un despliegue propio con vLLM exponen el mismo formato de /v1/chat/completions que usa la API de OpenAI, lo que facilita migrar código existente cambiando solo la URL base y el nombre del modelo.
¿Dónde se descarga?
Desde el repositorio oficial en Hugging Face, bajo la organización zai-org.
Referencias
- Z.ai Blog: anuncio oficial del lanzamiento de GLM-5.3.
- Hugging Face, zai-org: repositorio con los pesos publicados de la familia GLM.
- GitHub, zai-org: código y herramientas relacionadas con los modelos GLM.
- vLLM: motor de inferencia usado para servir el modelo con API compatible con OpenAI.
📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.
Imagen destacada: Foto de MARIOLA GROBELSKA en Unsplash
0 Comentarios