⏱️ Lectura: 13 min
Investigar un tema complejo con un asistente de IA solía costar como una suscripción premium por sesión: cerca de un dólar cada vez. Hoy, con los modelos pequeños de IA más recientes, ese mismo trabajo, cruzar miles de correos, rastrear la actividad de una persona en internet y armar un resumen personalizado, cuesta apenas diez centavos de dólar.
📑 En este artículo
- TL;DR
- Introducción
- Qué pasó: los modelos pequeños de IA bajaron el costo por consulta
- Contexto e historia: por qué casi no hay apps de IA de consumo
- Detalles técnicos y rendimiento: modelos frontera contra modelos rápidos
- Cómo empezar a probarlo
- Impacto y análisis
- Qué sigue
- Preguntas frecuentes
- ¿Qué es un modelo pequeño de IA?
- ¿Cuánto cuesta usar gpt-5.6-luna según este análisis?
- ¿Por qué no hay más apps de IA de consumo, según el autor?
- ¿Qué es el trabajo tipo “token spewer”?
- ¿Los modelos pequeños de IA reemplazan a los modelos frontera?
- ¿Qué falta para que los negocios adopten modelos pequeños de forma segura?
- Referencias
El desarrollador Calvin French-Owen, excofundador de Segment, documentó el cambio en un ensayo publicado el 26 de agosto de 2026 titulado “Small Models Have Arrived”. Su argumento central: los modelos rápidos y baratos ya alcanzaron un nivel de capacidad que hace viables productos de consumo que antes eran, económicamente, imposibles de sostener.
TL;DR
- gpt-5.6-luna resuelve investigaciones complejas, como buscar en miles de correos, por apenas centavos de dólar, según Calvin French-Owen.
- Con modelos de la generación Sonnet, esa misma tarea costaba cerca de $1 por sesión: insostenible para una app de $30 al mes.
- GLM 5.3 se sumó a la frontera de Pareto costo-rendimiento junto a gpt-5.6-luna, según el gráfico de artificialanalysis.ai.
- Peter Reinhardt, cofundador de Segment, dice que el 95% de su trabajo diario es tipo “token spewer”: respuesta rápida, no genio aislado.
- Reinhardt recaudó más de $100 millones para Charm Industrial y cerró una Serie A para Revoy.
- French-Owen usa los modelos más caros (Fable 5, 5.6 Sol) solo para programar; para investigación usa los baratos.
- La demanda de modelos frontera seguirá creciendo en ciencia; la de modelos rápidos y baratos recién despega para negocios.
Introducción
Durante años, la conversación pública sobre IA generativa giró en torno a los modelos más grandes y caros: los que resuelven problemas de investigación, generan código complejo o razonan sobre demostraciones matemáticas. Pero detrás de esa carrera por la frontera, otra categoría de modelos pequeños de IA avanzó en silencio: rápidos, baratos y sorprendentemente competentes para el trabajo del día a día.
Calvin French-Owen conoce ambos mundos. Cofundó Segment, la plataforma de datos de clientes, y hoy escribe sobre el estado del desarrollo con IA. En su ensayo del 26 de agosto de 2026 sostiene que el salto de calidad en modelos como gpt-5.6-luna y GLM 5.3 no es solo una mejora técnica: es un cambio en qué tipo de producto de consumo resulta viable construir.
Qué pasó: los modelos pequeños de IA bajaron el costo por consulta
French-Owen lleva semanas probando gpt-5.6-luna en tareas reales: revisar su código, leer su correo y consultar su base de conocimiento. Reporta velocidades de alrededor de 100 tokens por segundo y resultados que describe como sorprendentemente capaces.
Lo que más le llamó la atención no fue la velocidad sino el costo. Incluso al hacer que el modelo busque entre miles de correos electrónicos, el gasto total en llamadas a la API terminó en decenas de centavos de dólar, no en decenas de dólares. Para ponerlo a prueba con un caso concreto, French-Owen usa un “eval” personal: pedirle a un modelo que investigue su actividad pública, identifique qué noticias le interesarían y arme un micro-sitio diario personalizado, buscando en Hacker News, Reddit y Twitter.
Con la generación anterior de modelos, comparable a Claude Sonnet, esa tarea costaba cerca de un dólar por ejecución. Con gpt-5.6-luna, el resultado es “bastante decente” y el costo promedio baja a unos $0,10. Es la diferencia entre un producto que necesita cobrar como un diario premium (el Wall Street Journal o The Economist) y uno que puede regalarse o cobrarse centavos por uso.
El otro dato que French-Owen destaca es que GLM 5.3 se sumó a la frontera de Pareto de costo contra rendimiento, junto a gpt-5.6-luna, según el gráfico que cita de artificialanalysis.ai. Para tareas de programación, sin embargo, sigue prefiriendo los modelos más caros y capaces, Fable 5 y 5.6 Sol: la frontera y los modelos pequeños no compiten por el mismo trabajo, lo complementan.
Contexto e historia: por qué casi no hay apps de IA de consumo
Antes de la IA generativa, el manual para construir una app de consumo masiva era conocido: armar un sitio barato de mantener, conseguir usuarios con algo de viralidad, levantar capital para escalar y, eventualmente, montar un mercado de publicidad. Google, Facebook y Snapchat siguieron más o menos ese guion. Amazon y Netflix son las excepciones notables, según señala French-Owen.
Ese manual se rompe apenas se agrega un modelo de lenguaje al producto. Cada respuesta generada implica un costo real de inferencia por solicitud, y ese costo no baja a cero con la escala como sí bajaba el costo marginal de servir una página web. De golpe, el capital necesario para sostener millones de usuarios activos se dispara.
Esa es, según French-Owen, la respuesta a una pregunta que varios inversores le hicieron por separado: por qué no se ven más startups de IA de consumo. La respuesta corta es el costo por token. Si cada sesión de un usuario cuesta un dólar en llamadas a la API y el producto no puede cobrar $30 al mes sin ofrecer el valor de un medio como el Wall Street Journal, el modelo de negocio simplemente no cierra.
Detalles técnicos y rendimiento: modelos frontera contra modelos rápidos
French-Owen conecta esta caída de costos con una distinción que tomó prestada de Peter Reinhardt, su cofundador en Segment y hoy al frente de Charm Industrial (con más de $100 millones recaudados) y de Revoy, que acaba de cerrar una ronda Serie A. Reinhardt divide el trabajo dentro de una empresa en dos categorías:
- Trabajo “IQ 180”: el que resuelve un genio poco convencional, con una solución que nadie más había pensado. Requiere el modelo más capaz disponible.
- Trabajo “token spewer”: ser ultra responsivo, avanzar en decenas de frentes a la vez. Llamadas, seguimiento de pendientes, coordinación operativa.
Según Reinhardt, cerca del 95% de su trabajo diario cae en la segunda categoría, aunque aclara que sus empresas no sobrevivirían sin una mente “IQ 180” resolviendo los problemas técnicos de fondo. La mayoría del trabajo humano en cualquier compañía, sostiene French-Owen, se parece más a “token spewer” que a genialidad aislada: por eso la mayoría de las contrataciones favorecen el perfil rápido, barato y suficientemente bueno, no el genio excepcional.
Esta distinción explica por qué la demanda de modelos pequeños de IA y la demanda de modelos frontera no compiten entre sí, sino que crecen en paralelo, cada una para un tipo de tarea distinto:
| Categoría | Cuándo usarla | Ventaja | Limitación |
|---|---|---|---|
| Modelo frontera (Fable 5, GPT-5.6 Sol) | Ingeniería compleja, ciencia dura, entrenamiento de modelos | Máxima capacidad de razonamiento y descubrimiento | Costo por consulta alto: no escala a millones de sesiones gratuitas |
| Modelo pequeño y rápido (gpt-5.6-luna, GLM 5.3) | Atención al cliente, research liviano, apps de consumo, agentes de alto volumen | Costo por consulta de centavos, unos 100 tokens/s | Menor techo de razonamiento en problemas verdaderamente novedosos |
Un patrón que ya usan varios equipos para aprovechar ambas puntas es el de enrutar cada solicitud según su complejidad: un modelo pequeño clasifica y resuelve lo rutinario, y solo escala al modelo frontera cuando la tarea lo exige.
flowchart TD
A["Solicitud del usuario"] --> B["Router de complejidad"]
B -->|"tarea rutinaria"| C["Modelo pequeño: gpt-5.6-luna"]
B -->|"tarea novedosa o crítica"| D["Modelo frontera: Fable 5"]
C --> E["Respuesta al usuario"]
D --> E
💭 Clave: la clave no es elegir un modelo único, sino enrutar cada tarea al nivel de capacidad, y de costo, que realmente necesita.
Cómo empezar a probarlo
La mayoría de los modelos pequeños de IA, incluidos los que menciona French-Owen, se sirven detrás de una API compatible con OpenAI, así que probarlos no requiere un SDK nuevo. Basta con instalar el cliente oficial:
# macOS / Linux
npm install openai
# Windows (PowerShell)
npm install openai
# Alternativa con Python, cualquier sistema operativo
pip install openai
El ejemplo mínimo es una sola llamada de chat. Cambiando solo el nombre del modelo y el endpoint podés apuntar a distintos proveedores de modelos pequeños:
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.SMALL_MODEL_API_KEY,
baseURL: "https://api.proveedor-modelo-chico.com/v1",
});
const respuesta = await client.chat.completions.create({
model: "gpt-5.6-luna",
messages: [{ role: "user", content: "Resumí las noticias tech de hoy en 3 líneas." }],
});
console.log(respuesta.choices[0].message.content);
console.log(respuesta.usage);
El objeto usage de la respuesta trae los tokens de entrada y salida consumidos. Con ese dato podés calcular el costo real por consulta y decidir si conviene enrutar esa tarea a un modelo pequeño o escalarla a uno frontera:
function costoUSD(usage, precioEntrada, precioSalida) {
const entrada = (usage.prompt_tokens / 1000000) * precioEntrada;
const salida = (usage.completion_tokens / 1000000) * precioSalida;
return entrada + salida;
}
// Precios de ejemplo en dólares por millón de tokens
console.log(costoUSD(respuesta.usage, 0.15, 0.60));
Correr este cálculo en cada llamada te permite verificar en producción, con datos reales, que un cambio de modelo efectivamente bajó el gasto por consulta, en vez de asumirlo.
💡 Tip: guardá el campo usage de cada respuesta en tus logs; sin eso no hay forma de comprobar el ahorro real de usar un modelo pequeño.
Impacto y análisis
Para equipos de desarrollo en América Latina, esta caída de precio importa más que el debate sobre quién tiene el modelo más grande. Un costo de $0,10 por consulta compleja abre la puerta a productos con planes freemium reales, agentes de atención al cliente que responden en volumen y micro-SaaS que antes no cerraban números con modelos de la generación Sonnet.
French-Owen advierte que todavía falta trabajo de infraestructura antes de que esto sea seguro para negocios: nuevos harnesses (los sistemas que orquestan al modelo con herramientas y memoria), protecciones contra prompt injection y un esquema claro de roles y permisos, para que un modelo barato no termine con más autoridad de la que debería tener sobre datos sensibles.
La otra cara del argumento es que la demanda de modelos frontera no desaparece: French-Owen sigue usando Fable 5 y 5.6 Sol para programar, porque ahí el techo de capacidad importa más que el precio. Lo que cambia es que, por primera vez, hay una segunda categoría de producto viable: la que necesita un resultado suficientemente bueno a un costo casi nulo, no genialidad a cualquier precio.
Qué sigue
French-Owen espera que la demanda de modelos frontera siga creciendo en campos que exigen descubrimientos genuinamente nuevos: ingeniería avanzada, ciencia dura y entrenamiento de modelos. En paralelo, anticipa que la demanda de modelos rápidos, baratos y suficientemente buenos recién está despegando para el trabajo cotidiano de negocio: la mayoría de las interacciones que hoy resuelve una persona con un colega, un proveedor o un cliente.
Cierra su ensayo con una invitación abierta a quienes están experimentando con hacer útiles a los modelos pequeños de IA: compartir hallazgos, porque el harness, la capa de herramientas, permisos y seguridad alrededor del modelo, todavía es terreno en construcción.
📖 Resumen en Telegram: Ver resumen
Probalo vos: correé npm install openai, apuntá el baseURL a un proveedor de modelos pequeños y medí el campo usage de tu primera respuesta para ver el costo real en centavos.
Preguntas frecuentes
¿Qué es un modelo pequeño de IA?
Es un modelo de lenguaje optimizado para velocidad y costo bajo por consulta, en contraste con los modelos frontera, que priorizan la máxima capacidad de razonamiento sin importar el precio. gpt-5.6-luna y GLM 5.3 son ejemplos de esta categoría según el ensayo de Calvin French-Owen.
¿Cuánto cuesta usar gpt-5.6-luna según este análisis?
French-Owen reporta que investigaciones complejas, como buscar en miles de correos, terminan costando decenas de centavos de dólar en llamadas a la API, frente a cerca de un dólar con modelos de la generación Sonnet para una tarea equivalente.
¿Por qué no hay más apps de IA de consumo, según el autor?
Porque agregar un modelo de lenguaje a un producto introduce un costo de inferencia real en cada solicitud, algo que no existía en el manual clásico de apps de consumo: sitio barato, viralidad, publicidad. Ese costo dispara el capital necesario para escalar.
¿Qué es el trabajo tipo “token spewer”?
Es el término que usa Peter Reinhardt, cofundador de Segment, para describir tareas de respuesta rápida y coordinación, como llamadas y seguimiento de pendientes, que ocupan cerca del 95% del trabajo diario en una empresa, en contraste con el trabajo “IQ 180” de resolver problemas novedosos.
¿Los modelos pequeños de IA reemplazan a los modelos frontera?
No, según French-Owen: él sigue usando modelos frontera como Fable 5 y 5.6 Sol para programar. Los modelos pequeños abren una categoría distinta de producto, la de tareas de alto volumen y bajo margen por consulta.
¿Qué falta para que los negocios adopten modelos pequeños de forma segura?
Nuevos harnesses de orquestación, protecciones contra prompt injection y esquemas de roles y permisos, según señala French-Owen en su ensayo.
Referencias
- Small Models Have Arrived: ensayo original de Calvin French-Owen, publicado el 26 de agosto de 2026.
- Artificial Analysis: benchmark independiente de costo y rendimiento de modelos de lenguaje, citado como fuente del gráfico de Pareto.
- OpenAI API Reference: documentación del formato de API compatible que usan la mayoría de los proveedores de modelos pequeños.
📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.
Imagen destacada: Foto de Brecht Corbeel en Unsplash
0 Comentarios