El Solitario

  • GNU/Linux
  • Tutoriales
  • Opinión

inferencia

Diagrama de la compresión de modelos en el catálogo de Cerebras Inference
Noticias Tech

Cerebras detalla su catálogo de inferencia: GPT OSS 120B corre a 3.000 tokens/s

Cerebras actualizó la documentación de su servicio de inferencia con la tabla de modelos disponibles y una explicación detallada de su política de compresión de modelos: cuantización selectiva por capas, sin poda de arquitectura en producción.

Por Andrés Morales, hace 6 horas
Ilustración de modelos pequeños de ia procesando tareas a bajo costo y alta velocidad
Inteligencia Artificial

gpt-5.6-luna: 100 tokens por segundo por centavos de dólar

gpt-5.6-luna resuelve tareas de investigación complejas por centavos de dólar y a unos 100 tokens por segundo, según documentó Calvin French-Owen. El hallazgo, sumado a la llegada de GLM 5.3 a la frontera de Pareto costo-capacidad, redefine qué apps de ia de consumo son económicamente viables.

Por Andrés Morales, hace 1 semana
Diagrama de KL divergence en la inferencia de un LLM local
Inteligencia Artificial

KL divergence explica por qué tu LLM local rinde peor que el original

Un análisis técnico publicado en los foros de Level1Techs muestra cómo los backends de atención, la cuantización y los ajustes de sampler alteran la salida de un LLM local respecto al modelo de referencia. La métrica clave para medir esa diferencia es la KL divergence.

Por Andrés Morales, hace 2 semanas
Chip wafer-scale de Cerebras potenciando GPT-5.6 Sol Ultrafast
Inteligencia Artificial

Cerebras acelera GPT-5.6 Sol a 750 tokens por segundo con OpenAI

Cerebras y OpenAI presentaron Ultrafast Mode, una nueva capa de inferencia que hace correr a GPT-5.6 Sol hasta 750 tokens de salida por segundo. En el examen Humanity’s Last Exam, el modelo resolvió 2.500 preguntas en 11 horas y 11 minutos, casi siete veces más rápido que Claude Fable 5.

Por Andrés Morales, hace 3 semanas13 agosto, 2026
Chip de Taalas con pesos de un modelo de IA grabados en silicio, tecnología adquirida por AMD
Inteligencia Artificial

AMD compra Taalas: chips que graban modelos en silicio a 17.000 tokens/s

AMD adquirió Taalas, una startup de Toronto que graba los pesos de modelos de IA directamente en el silicio de sus chips. El primer prototipo sirvió Llama 3.1 8B a 16.960 tokens por segundo, y AMD planea combinarlo con sus GPU Instinct en despliegues de inferencia a gran escala.

Por Andrés Morales, hace 4 semanas
Diagrama de AirLLM cargando capas de Kimi K3 por streaming en una GPU de 4 GB
Inteligencia Artificial

AirLLM ejecuta Kimi K3, el modelo abierto más grande, en 3.72 GB de VRAM

AirLLM, la librería open source que permite correr modelos gigantes en poca memoria, ya soporta Kimi K3: el modelo abierto de 2.8 billones de parámetros que ahora corre en una sola GPU de menos de 4 GB. La técnica de streaming por experto evita cargar el modelo completo en memoria.

Por Andrés Morales, hace 1 mes
Centro de datos con GPUs procesando el costo de inferencia de un modelo de IA
Inteligencia Artificial

Modelos de IA abiertos no son gratis: el COGS que ignora Wall Street

Ben Thompson argumenta en Stratechery que los modelos de pesos abiertos como Kimi K3 no son gratis de servir: el costo de inferencia, no el precio de licencia, es lo que define el margen de la industria de IA. El debate reabre la pregunta de qué gana realmente cuando un modelo compite con un rival que cobra menos por token pero necesita más tokens para responder.

Por Andrés Morales, hace 2 meses
GPU en un centro de datos representando el COGS de la IA en inferencia
Inteligencia Artificial

Ben Thompson: la inteligencia es el commodity de la IA, no los tokens

Ben Thompson analiza en Stratechery por qué los modelos abiertos chinos como Kimi K3 no son gratis de servir. El ensayo distingue el COGS de la IA, un costo variable, de la inversión fija en investigación y desarrollo, y explica por qué los tokens no son un commodity fungible.

Por Andrés Morales, hace 2 meses
Centro de datos con GPU procesando tokens, ilustrando el costo de inferencia de la IA
Inteligencia Artificial

Kimi K3 cobra $3 y $15 por millón de tokens, pero no es gratis servirlo

Kimi K3 cobra $3 por millón de tokens de entrada y $15 de salida, pero eso no significa que sea gratis de servir. Un análisis de Stratechery separa el R&D fijo del COGS variable y explica por qué el precio por token no captura el costo real de la inteligencia.

Por Andrés Morales, hace 2 meses
Cursos sobre Linux
Introducción a Linux: Instala Linux en tu PC

Introducción a Linux: Instala Linux en tu PC

Empieza seguro en Linux

4.2 | Gratis


Aprendiendo Linux: uso, terminal y comandos

Aprendiendo Linux: uso, terminal y comandos

Aprende sobre el entorno de escritorio y los comandos básicos de GNU/Linux

4.7 | $19.99

El Solitario > inferencia
Entradas recientes
  • Agentes de OpenAI usaron una wiki alemana para coludirse: 18.000 posts
  • Cerebras detalla su catálogo de inferencia: GPT OSS 120B corre a 3.000 tokens/s
  • Any Human Ever: la web que simula una vida entre 100.000 millones
  • ICANN aprueba terminar el nivel 3 de .name: 22.000 dominios en riesgo
  • OpenTelemetry: el estándar que unifica trazas, métricas y logs
Categorías
  • GNU/Linux
  • Inteligencia Artificial
  • Microservicios
  • Noticias Tech
  • Opinión
  • Programación
  • Redes
  • Seguridad
  • Tutoriales
Comentarios recientes
  • Casey en El estándar OpenAI-compatible API: auditoría técnica del contrato de-facto que unificó la inferencia LLM (2020–2026)
  • Angel_Bran en Solucionar el problema con VSYNC en Linux
  • Angel_Bran en Configurar GRUB en Ubuntu y derivados: Cambiar el orden de arranque por defecto
  • Sergio en Configurar GRUB en Ubuntu y derivados: Cambiar el orden de arranque por defecto
  • carlitos en Solucionar el problema con VSYNC en Linux
Etiquetas
accesibilidad agentes algoritmos amazon amd android anthropic apple aprendizaje benchmark benchmarks busqueda c2pa china cifrado claude codex costos cuantizacion firmware github gpu hardware huggingface inferencia Javascript kimi Linux llm microsoft modelos moe moonshot openai opensource privacidad Programacion Python qwen regulacion rust seguridad sqlite vibecoding wcag
  • Política de privacidad
Hestia | Desarrollado por ThemeIsle