El Solitario

  • GNU/Linux
  • Tutoriales
  • Opinión

inferencia

Chip de Taalas con pesos de un modelo de IA grabados en silicio, tecnología adquirida por AMD
Inteligencia Artificial

AMD compra Taalas: chips que graban modelos en silicio a 17.000 tokens/s

AMD adquirió Taalas, una startup de Toronto que graba los pesos de modelos de IA directamente en el silicio de sus chips. El primer prototipo sirvió Llama 3.1 8B a 16.960 tokens por segundo, y AMD planea combinarlo con sus GPU Instinct en despliegues de inferencia a gran escala.

Por Andrés Morales, hace 6 días
Diagrama de AirLLM cargando capas de Kimi K3 por streaming en una GPU de 4 GB
Inteligencia Artificial

AirLLM ejecuta Kimi K3, el modelo abierto más grande, en 3.72 GB de VRAM

AirLLM, la librería open source que permite correr modelos gigantes en poca memoria, ya soporta Kimi K3: el modelo abierto de 2.8 billones de parámetros que ahora corre en una sola GPU de menos de 4 GB. La técnica de streaming por experto evita cargar el modelo completo en memoria.

Por Andrés Morales, hace 1 semana
Centro de datos con GPUs procesando el costo de inferencia de un modelo de IA
Inteligencia Artificial

Modelos de IA abiertos no son gratis: el COGS que ignora Wall Street

Ben Thompson argumenta en Stratechery que los modelos de pesos abiertos como Kimi K3 no son gratis de servir: el costo de inferencia, no el precio de licencia, es lo que define el margen de la industria de IA. El debate reabre la pregunta de qué gana realmente cuando un modelo compite con un rival que cobra menos por token pero necesita más tokens para responder.

Por Andrés Morales, hace 3 semanas
GPU en un centro de datos representando el COGS de la IA en inferencia
Inteligencia Artificial

Ben Thompson: la inteligencia es el commodity de la IA, no los tokens

Ben Thompson analiza en Stratechery por qué los modelos abiertos chinos como Kimi K3 no son gratis de servir. El ensayo distingue el COGS de la IA, un costo variable, de la inversión fija en investigación y desarrollo, y explica por qué los tokens no son un commodity fungible.

Por Andrés Morales, hace 3 semanas
Centro de datos con GPU procesando tokens, ilustrando el costo de inferencia de la IA
Inteligencia Artificial

Kimi K3 cobra $3 y $15 por millón de tokens, pero no es gratis servirlo

Kimi K3 cobra $3 por millón de tokens de entrada y $15 de salida, pero eso no significa que sea gratis de servir. Un análisis de Stratechery separa el R&D fijo del COGS variable y explica por qué el precio por token no captura el costo real de la inteligencia.

Por Andrés Morales, hace 3 semanas
Cursos sobre Linux
Introducción a Linux: Instala Linux en tu PC

Introducción a Linux: Instala Linux en tu PC

Empieza seguro en Linux

4.2 | Gratis


Aprendiendo Linux: uso, terminal y comandos

Aprendiendo Linux: uso, terminal y comandos

Aprende sobre el entorno de escritorio y los comandos básicos de GNU/Linux

4.7 | $19.99

El Solitario > inferencia
Entradas recientes
  • Grok 4.6: xAI iguala a GPT-5.6 Sol Max en el índice de Artificial Analysis
  • NVIDIA lanza Nemotron 3.5 Lightning, un MoE de 30B para agentes IA
  • Ngrok: compresores y LLM resuelven el mismo problema matemático
  • Stolen Thoughts: filtran 704 secretos del razonamiento cifrado de la IA
  • AMD se alía con un ministerio de ciencia para abrir modelos de IA
Categorías
  • GNU/Linux
  • Inteligencia Artificial
  • Microservicios
  • Noticias Tech
  • Opinión
  • Programación
  • Redes
  • Seguridad
  • Tutoriales
Comentarios recientes
  • Casey en El estándar OpenAI-compatible API: auditoría técnica del contrato de-facto que unificó la inferencia LLM (2020–2026)
  • Angel_Bran en Solucionar el problema con VSYNC en Linux
  • Angel_Bran en Configurar GRUB en Ubuntu y derivados: Cambiar el orden de arranque por defecto
  • Sergio en Configurar GRUB en Ubuntu y derivados: Cambiar el orden de arranque por defecto
  • carlitos en Solucionar el problema con VSYNC en Linux
Etiquetas
agentes algebra algoritmos anthropic arquitectura atencion autoaprendizaje benchmark benchmarks china chips cli codex cogs electronica fork github gpu grok inferencia Javascript kimi llm matematicas microsoft moe moonshot opencode opensource openweight optimizacion productividad Programacion Python qwen razonamiento regulacion robots rust seguridad sqlite tokens vibecoding vpn xai
  • Política de privacidad
Hestia | Desarrollado por ThemeIsle