Noticias Tech Cerebras detalla su catálogo de inferencia: GPT OSS 120B corre a 3.000 tokens/sCerebras actualizó la documentación de su servicio de inferencia con la tabla de modelos disponibles y una explicación detallada de su política de compresión de modelos: cuantización selectiva por capas, sin poda de arquitectura en producción. Por Andrés Morales, hace 7 horas