⏱️ Lectura: 12 min
El catálogo de modelos de Cerebras Inference lista hoy solo dos modelos en sus endpoints públicos, GPT OSS 120B y Qwen 3.8 27B, y junto a ellos la compañía publicó una explicación detallada de su compresión de modelos: cuantización selectiva por capas, sin poda de arquitectura. Es una declaración inusual en un mercado donde casi ningún proveedor de inferencia dice exactamente qué le hizo a los pesos que sirve.
📑 En este artículo
La política importa porque Cerebras vende velocidad como diferencial (hasta 3.000 tokens por segundo en GPT OSS 120B) y la comunidad técnica suele desconfiar de esa velocidad cuando no sabe si viene de podar capas o de hardware real. La documentación oficial despeja esa duda modelo por modelo.
TL;DR
- Cerebras Inference ofrece hoy solo dos modelos en endpoints públicos: GPT OSS 120B y Qwen 3.8 27B.
- GPT OSS 120B: 120.000 millones de parámetros, contexto de 65k (gratis) a 131k (pago), ~3.000 tokens/s.
- Qwen 3.8 27B: 27.000 millones de parámetros, contexto de 64k (gratis) a 128k (pago), ~1.500 tokens/s.
- Cerebras confirma que ningún modelo público está podado: todos son versiones originales sin cambios de arquitectura.
- La única compresión aplicada es cuantización selectiva por capas, en 16, 8 o 4 bits, solo para almacenamiento.
- Activaciones, atención y KV cache se mantienen en precisión completa y sin cuantizar durante el cómputo.
- La poda vive aparte: la técnica REAP se publica en Hugging Face para investigación, no llega a la API compartida.
- Cerebras se compromete a nombrar por separado cualquier futura variante podada, sin reemplazar un modelo existente.
Qué pasó
Cerebras actualizó la página de referencia de su servicio de inferencia con dos cambios concretos. El primero es la tabla de modelos disponibles en los tiers gratuito y de pago por uso: GPT OSS 120B, de OpenAI, y Qwen 3.8 27B, de Alibaba. El segundo es una sección nueva de compresión de modelos que explica, con FAQ incluida, qué le hace Cerebras a los pesos antes de servirlos.
La compañía separa tres cosas que normalmente quedan implícitas en la documentación de otros proveedores de inferencia: qué modelos aloja hoy, cómo los comprime para guardarlos y cómo aísla esa compresión de su investigación de poda. Ninguna de las tres respuestas queda librada a la interpretación del lector.
Para acceder a modelos adicionales fuera de esta lista corta, como otras familias abiertas, Cerebras remite a su producto de Dedicated Endpoints, con capacidad reservada y SLAs de producción; el catálogo público que se actualizó ahora funciona como puerta de entrada gratuita o de pago por uso, sin compromiso de capacidad.
Contexto e historia
Cerebras no es un proveedor de GPU convencional. Su hardware, el Wafer Scale Engine, monta el modelo completo en un solo chip del tamaño de una oblea y elimina buena parte de la latencia de mover pesos entre memoria y cómputo que sufre una GPU tradicional. Esa arquitectura es la razón por la que la empresa puede prometer miles de tokens por segundo en modelos abiertos sin depender únicamente de agrupar peticiones en lotes.
El problema es que velocidad y compresión suelen ir de la mano en el marketing de inferencia: es fácil acelerar un modelo si se lo poda o se lo cuantiza de forma agresiva, y es difícil para un desarrollador externo comprobar cuál de las dos cosas está pasando realmente. La FAQ que Cerebras agregó responde de forma directa a esa sospecha: la pregunta explícita es si van a cambiar la arquitectura de un modelo sin avisar, y la respuesta es no. La compañía distingue cuantización de poda para que no se confundan como sinónimos.
La poda sí existe en el trabajo de Cerebras, pero vive en otro lado. La empresa investiga una técnica llamada REAP (Router-weighted Expert Activation Pruning), pensada para modelos de mezcla de expertos, donde el objetivo es eliminar los expertos que el router activa con menos frecuencia sin degradar demasiado la calidad. Esos modelos podados se publican en una colección de Hugging Face para uso de investigación. Ninguno de ellos llega a la API compartida de Cerebras Inference.
Compresión de modelos: cuantización sin poda
La diferencia entre cuantización y poda parece técnica, pero cambia el resultado final. Cuantizar significa guardar los mismos parámetros con menos bits: pasar un peso de 16 bits a 8 o 4 bits reduce memoria sin tocar cuántas neuronas o capas tiene el modelo. Podar, en cambio, elimina partes enteras de la arquitectura (capas, expertos, cabezas de atención) y produce, literalmente, otro modelo distinto.
Cerebras aplica solo la primera en sus endpoints públicos. Según la documentación, la compresión de modelos en su plataforma es cuantización selectiva de pesos aplicada únicamente al almacenamiento: los pesos se guardan en una mezcla de 16, 8 y 4 bits según la capa, con las capas más sensibles a error mantenidas en precisión completa y descuantizadas al vuelo antes de operar sobre ellas. Las activaciones, la atención y el KV cache permanecen en precisión completa durante toda la inferencia, sin cuantizar.
💡 Tip: Si necesitás reproducir un resultado de forma consistente entre proveedores, preguntá primero si el modelo está podado, no solo si está cuantizado: la cuantización cambia precisión numérica, la poda cambia la arquitectura.
Detalles técnicos y rendimiento
La tabla pública de Cerebras Inference deja ver, además del catálogo, el equilibrio real entre velocidad y contexto que ofrece cada uno de los dos modelos disponibles hoy en endpoints compartidos:
| Modelo | Parámetros | Contexto (gratis / pago) | Velocidad aproximada | Cuándo conviene |
|---|---|---|---|---|
| GPT OSS 120B | 120.000 millones | 65k / 131k tokens | ~3.000 tokens/s | Tareas que necesitan más contexto y máxima velocidad |
| Qwen 3.8 27B | 27.000 millones | 64k / 128k tokens | ~1.500 tokens/s | Cargas más livianas, menor costo de cómputo |
GPT OSS 120B, con 120.000 millones de parámetros, es el modelo grande de la lista: 65.000 tokens de contexto en el tier gratuito, 131.000 en el de pago por uso, y una velocidad de referencia cercana a 3.000 tokens por segundo. Qwen 3.8 27B es la opción liviana, con 27.000 millones de parámetros, 64.000 tokens de contexto gratis y 128.000 de pago, corriendo a unos 1.500 tokens por segundo.
El siguiente diagrama resume qué pasa con los pesos de cualquiera de los dos modelos entre que llega una petición y sale la respuesta:
flowchart TD
A["Cliente / SDK"] --> B["Cerebras Inference API"]
B --> C{"Modelo solicitado"}
C -->|"gpt-oss-120b"| D["Pesos en 4/8/16-bit por capa"]
C -->|"qwen-3.8-27b"| D
D --> E["Capas sensibles en precision completa"]
E --> F["Atencion y KV cache sin cuantizar"]
F --> G["Respuesta al cliente"]
El punto donde más vale la pena detenerse es el paso de capas sensibles en precisión completa. Cerebras no cuantiza todo por igual: identifica qué capas son más sensibles a la pérdida de precisión, típicamente las de normalización y ciertas proyecciones de atención, y las mantiene en 16 bits o superior, mientras el resto del modelo baja a 8 o 4 bits para ahorrar memoria en el chip.
Para confirmar en la práctica que la API devuelve el modelo que se pidió, y no una variante silenciosa, el llamado más simple es un curl directo al endpoint de chat completions:
curl https://api.cerebras.ai/v1/chat/completions \n -H "Authorization: Bearer $CEREBRAS_API_KEY" \n -H "Content-Type: application/json" \n -d '{
"model": "qwen-3.8-27b",
"messages": [{"role": "user", "content": "Explica que es la cuantizacion selectiva por capas"}]
}'
La respuesta trae el campo model con el mismo ID que se envió, gpt-oss-120b o qwen-3.8-27b. Si algún día Cerebras ofreciera una variante podada, según su propia política, esa variante tendría un ID de modelo distinto y explícito, nunca reemplazaría al original bajo el mismo nombre.
Cómo empezar
Probar cualquiera de los dos modelos toma minutos porque la API de Cerebras Inference es compatible con el SDK de OpenAI: alcanza con cambiar la URL base y la API key.
Instalar el SDK (Windows, macOS y Linux)
El único paso previo es instalar el cliente de Python; el comando es idéntico en las tres plataformas, ya sea desde PowerShell en Windows o desde una terminal en macOS y Linux:
# Windows (PowerShell), macOS y Linux: mismo comando
pip install openai
Con el SDK instalado, alcanza con apuntar el base_url al dominio de Cerebras y usar la API key generada en el panel de la cuenta:
from openai import OpenAI
client = OpenAI(
base_url="https://api.cerebras.ai/v1",
api_key="TU_CEREBRAS_API_KEY",
)
respuesta = client.chat.completions.create(
model="gpt-oss-120b",
messages=[
{"role": "system", "content": "Eres un asistente tecnico conciso."},
{"role": "user", "content": "Resumime en 3 lineas que es REAP de Cerebras."},
],
max_tokens=300,
)
print(respuesta.choices[0].message.content)
print(respuesta.model) # confirma que modelo respondio
Ese script pide una respuesta de GPT OSS 120B, imprime el texto y además el campo model de la respuesta, que sirve como verificación rápida de que el backend efectivamente ejecutó el modelo solicitado.
Impacto y análisis
Para un equipo que evalúa proveedores de inferencia, esta transparencia cambia una pregunta habitual de “confío en que no está podado” a “puedo verificarlo leyendo la documentación”. No es un dato menor cuando la velocidad es el argumento de venta: separar qué parte del rendimiento viene del hardware y qué parte vendría de recortar el modelo permite comparar proveedores en igualdad de condiciones.
💭 Clave: Cerebras separa investigación de producto: REAP demuestra que la poda funciona y ahorra memoria, pero solo llega a Hugging Face para experimentación, nunca reemplaza en silencio un modelo ya publicado en la API compartida.
La limitación real de este anuncio es que el catálogo público sigue siendo corto: solo dos modelos hoy, frente a la oferta mucho más amplia que otros proveedores de inferencia ofrecen en sus tiers gratuitos. Para acceder a más familias de modelos hace falta pasar a Dedicated Endpoints, que implica capacidad reservada y, previsiblemente, un costo distinto al de pago por uso. Quien necesite variedad de modelos hoy mismo, sin compromiso de capacidad, va a encontrar un catálogo más amplio en otros proveedores; quien priorice velocidad verificable en los dos modelos que sí están disponibles, encuentra en Cerebras una opción con reglas claras y documentadas.
Qué sigue
La documentación deja una puerta abierta explícita: si Cerebras decide ofrecer alguna vez una variante podada en producción, se serviría bajo un endpoint con nombre específico de poda, nunca reemplazando el ID de un modelo existente. Es razonable esperar también que el catálogo público crezca con nuevas familias abiertas a medida que aparezcan, replicando el mismo patrón de pocas entradas por vez que se vio con GPT OSS 120B y Qwen 3.8 27B.
La investigación de REAP, mientras tanto, sigue publicándose para la comunidad en Hugging Face, separada del producto comercial; es ahí donde conviene mirar si el interés es entender qué tan lejos se puede llevar la poda de modelos de mezcla de expertos sin perder calidad, no en los endpoints de producción de Cerebras Inference.
📖 Resumen en Telegram: Ver resumen
Probalo vos: generá una API key en Cerebras y corré el ejemplo de curl de arriba contra gpt-oss-120b para ver la velocidad de golpe, sin esperar a que otro te lo cuente.
Preguntas frecuentes
¿Cerebras poda los modelos que sirve en producción?
No. La documentación oficial establece que ningún modelo en los endpoints públicos de Cerebras Inference está podado; todos son versiones originales sin modificación de arquitectura.
¿Qué es REAP y dónde se puede probar?
REAP (Router-weighted Expert Activation Pruning) es la técnica de poda que investiga Cerebras para modelos de mezcla de expertos. Los modelos resultantes se publican en una colección de Hugging Face para investigación, no en la API compartida.
¿La cuantización que aplica Cerebras afecta la calidad de las respuestas?
Cerebras cuantiza los pesos solo para almacenamiento, en una mezcla de 16, 8 y 4 bits según la capa, mantiene las capas sensibles en precisión completa, y deja activaciones, atención y KV cache sin cuantizar durante el cómputo, lo que limita el impacto frente a una cuantización uniforme y agresiva.
¿Qué modelos están disponibles hoy en el tier gratuito?
GPT OSS 120B, con 120.000 millones de parámetros y hasta 65k tokens de contexto gratis, y Qwen 3.8 27B, con 27.000 millones de parámetros y hasta 64k tokens de contexto gratis.
¿Cómo accedo a más modelos además de estos dos?
Cerebras ofrece familias adicionales a través de Dedicated Endpoints, un producto con capacidad reservada y SLAs de producción, pensado para cargas que superan lo que cubre el catálogo público.
Referencias
- Cerebras Inference, Model Catalog: fuente primaria con la tabla de modelos y la política de compresión.
- Hugging Face: donde Cerebras publica su colección de modelos podados con REAP para investigación.
- Cerebras: sitio oficial de la empresa detrás del Wafer Scale Engine y de Cerebras Inference.
- OpenAI: origen del modelo de pesos abiertos GPT OSS 120B, disponible también en otros proveedores de inferencia.
📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.
0 Comentarios