⏱️ Lectura: 13 min
Calvin French-Owen, cofundador de Segment, llevó semanas probando gpt-5.6-luna, un modelo de ia liviano y rápido. En una prueba le pidió que revisara miles de sus correos electrónicos en busca de patrones: la factura final rondó los diez centavos de dólar. Ese número, no la inteligencia del modelo, es la noticia.
📑 En este artículo
- TL;DR
- Introducción
- Qué pasó
- Contexto e historia
- Detalles técnicos y rendimiento
- Cómo probarlo
- Impacto y análisis de los modelos pequeños de ia
- Qué sigue
- Preguntas frecuentes
- ¿Qué es gpt-5.6-luna?
- ¿Por qué los modelos pequeños de ia son importantes para construir apps?
- ¿GLM 5.3 es lo mismo que gpt-5.6-luna?
- ¿Los modelos pequeños de ia reemplazan a los modelos de frontera como Fable 5?
- ¿Qué falta para que las empresas deleguen tareas de negocio a modelos pequeños sin supervisión?
- ¿Cuánto cuesta el experimento del micrositio de noticias personalizado?
- Referencias
Durante dos años la conversación sobre ia giró en torno a qué tan lejos podían llegar los modelos más grandes y caros. Ahora hay una segunda historia, más silenciosa: los modelos pequeños de ia ya son lo bastante buenos y baratos para sostener productos completos, no solo demos.
TL;DR
- gpt-5.6-luna procesa cerca de 100 tokens por segundo en uso real, según Calvin French-Owen, cofundador de Segment.
- Una tarea de investigación compleja con gpt-5.6-luna, como revisar miles de correos, cuesta apenas centavos de dólar.
- Con modelos clase Sonnet (generación anterior), la misma tarea rondaba 1 dólar por ejecución.
- GLM 5.3 entra a la frontera de Pareto costo-capacidad junto a gpt-5.6-luna, según artificialanalysis.ai.
- Un micrositio de noticias personalizado diario bajó de ~1 dólar a ~0,10 dólares por ejecución con gpt-5.6-luna.
- Para programación compleja, French-Owen sigue prefiriendo modelos caros como Fable 5 y GPT-5.6 Sol.
- Peter Reinhardt (Charm Industrial, Revoy) estima que el 95% de su trabajo diario es tarea repetitiva, no genio técnico.
Introducción
La discusión pública sobre modelos de lenguaje giró durante años en torno a la capacidad: qué modelo razona mejor, cuál programa sin errores, cuál resuelve matemáticas de nivel olímpico. Ese eje sigue existiendo, pero apareció un segundo eje tan relevante como el primero: el costo por tarea. Calvin French-Owen documentó en su blog la experiencia de usar gpt-5.6-luna, un modelo pequeño y veloz que, según él, resuelve tareas complejas de investigación por centavos de dólar.
El cambio no es solo técnico, modifica qué tipo de producto de ia es viable construir. Durante la era de los modelos clase Sonnet, ejecutar una consulta compleja podía costar alrededor de 1 dólar. Cobrar 30 dólares al mes por una app de consumo con ese costo de inferencia era, en palabras de French-Owen, insostenible.
Qué pasó
French-Owen pasó varias semanas probando gpt-5.6-luna en tareas cotidianas: revisar su código, su correo y su base de conocimiento personal. Reporta velocidades de alrededor de 100 tokens por segundo y facturas de API de apenas centavos de dólar, incluso al hacer que el modelo busque patrones en miles de correos electrónicos.
El punto de comparación que usa es un experimento personal que repite cada cierto tiempo: pedirle a un modelo que investigue su actividad pública, entienda qué noticias podrían interesarle y arme un micrositio diario personalizado con lo más relevante de Hacker News, Reddit y Twitter. Con la generación anterior de modelos clase Sonnet, ese experimento costaba cerca de 1 dólar por ejecución. Con gpt-5.6-luna, el costo promedio bajó a unos 0,10 dólares.
En paralelo, artificialanalysis.ai ubicó a GLM 5.3 en la frontera de Pareto costo-capacidad, es decir, entre los modelos con mejor relación entre lo que cuestan y lo que resuelven. French-Owen aclara que para programación sigue prefiriendo modelos más caros y capaces, como Fable 5 y GPT-5.6 Sol, pero admite que esa preferencia le hizo perder de vista el avance de los modelos pequeños.
Contexto e historia
El manual clásico de una empresa de consumo masivo, previo a la ia generativa, fue simple durante dos décadas: construir un sitio barato de operar, conseguir usuarios con algo de viralidad, levantar capital para escalar y, eventualmente, montar un mercado de publicidad. Google, Facebook y Snapchat siguieron ese camino, con Amazon y Netflix como las excepciones que French-Owen señala.
Agregar ia generativa a ese modelo rompe el primer paso: ya no alcanza con un sitio barato de operar, porque cada respuesta de un modelo grande implica un costo de inferencia real por usuario. Eso explica, según inversores citados por French-Owen, por qué no surgieron más startups de ia de consumo pese a dos años de inversión récord en el sector: el costo por token todavía no bajaba lo suficiente como para sostener un precio de suscripción razonable.
Los modelos pequeños de ia cambian esa cuenta. No compiten por el primer puesto en los benchmarks de razonamiento, compiten por ser lo bastante buenos a una fracción del costo, y esa fracción es la que determina si un producto de consumo con ia es viable a escala.
Detalles técnicos y rendimiento
La cifra que French-Owen repite es la velocidad: ~100 tokens por segundo en uso real con gpt-5.6-luna, suficiente para que la latencia deje de sentirse como una espera y empiece a sentirse como una conversación. La velocidad importa tanto como el costo, porque un modelo lento, aunque barato, sigue siendo inviable para productos interactivos.
En el otro extremo de la frontera de capacidad están los modelos que French-Owen reserva para programar: Fable 5 y GPT-5.6 Sol. Son los que usa para lo que su excompañero de Segment, Peter Reinhardt, describe como trabajo IQ 180: un puñado de problemas donde hace falta una solución novedosa que nadie pensó antes. El resto (que Reinhardt estima en el 95% del trabajo que hace al manejar varias empresas, entre ellas Charm Industrial y Revoy) es lo que llama trabajo token spewer: responder rápido, coordinar personas, avanzar en paralelo en decenas de frentes.
💭 Clave: Reinhardt levantó más de 100 millones de dólares para Charm Industrial y cerró una serie A para Revoy, y aun así calcula que el 95% de su trabajo diario no requiere genio técnico, requiere responder rápido.
Esa distinción importa para elegir modelo en un pipeline real. No todas las llamadas a un LLM necesitan el modelo más caro disponible, y tratarlas todas igual desperdicia el ahorro que ofrecen los modelos pequeños de ia.
| Modelo o clase | Uso típico | Costo aproximado por tarea compleja | Limitación |
|---|---|---|---|
| gpt-5.6-luna | Investigación diaria, correo, base de conocimiento | Centavos de dólar (~0,10 en el eval de French-Owen) | No es el modelo elegido para programación difícil |
| Modelos clase Sonnet (generación anterior) | Investigación compleja | ~1 dólar por tarea | Insostenible para una suscripción de consumo de 30 dólares/mes |
| Fable 5 / GPT-5.6 Sol | Programación compleja, problemas IQ 180 | Alto, no es el foco del ahorro | Frontera de capacidad, no de costo |
| GLM 5.3 | Trabajo general y agentic | Nuevo punto en la frontera de Pareto costo-capacidad | Datos de rendimiento aún limitados a artificialanalysis.ai |
Cómo probarlo
Para replicar el experimento del micrositio de noticias personalizado, la arquitectura mínima es sencilla: un paso de investigación (buscar en HN, Reddit y menciones públicas del usuario), un paso de síntesis (elegir qué importa) y un paso de generación (armar el resumen). El ahorro no está en el código, está en enrutar cada paso al modelo correcto según su costo.
Un llamado mínimo usando una API compatible con el formato que hoy soportan la mayoría de proveedores de modelos chicos se ve así:
curl https://api.ejemplo-proveedor.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "modelo-pequeno-rapido",
"messages": [
{"role": "system", "content": "Sos un investigador que resume noticias tech."},
{"role": "user", "content": "Busca las noticias mas relevantes de hoy en HN y Reddit para un desarrollador backend."}
],
"max_tokens": 800
}'
Esa llamada devuelve un resumen en segundos y, con un modelo pequeño, a un costo de centavos por ejecución.
Para enrutar automáticamente entre un modelo barato y uno caro según la complejidad de la tarea, un patrón habitual en producción es decidir el modelo antes de llamar, no después:
function elegirModelo(tarea) {
const esCompleja = tarea.requiereRazonamientoProfundo || tarea.tokensEstimadosSalida > 4000;
return esCompleja ? "modelo-frontera-caro" : "modelo-pequeno-rapido";
}
async function ejecutarTarea(tarea) {
const modelo = elegirModelo(tarea);
const respuesta = await llamarLLM(modelo, tarea.prompt);
console.log(`Modelo usado: ${modelo}, tokens de salida: ${respuesta.usage.completion_tokens}`);
return respuesta;
}
El siguiente diagrama resume ese enrutamiento:
flowchart TD
A["Tarea entrante"] --> B{"Es compleja?"}
B -- "No" --> C["Modelo pequeño y rápido"]
B -- "Si" --> D["Modelo de frontera, caro"]
C --> E["Respuesta al usuario"]
D --> E
Para confirmar que el enrutamiento funciona como se espera, lo más simple es loguear el modelo usado y el costo estimado por llamada (la mayoría de proveedores devuelve el conteo de tokens de entrada y salida en la misma respuesta) y sumarlo por día. Si el costo promedio por tarea se acerca a los centavos de dólar que reporta French-Owen para gpt-5.6-luna, el pipeline está bien enrutado. Si se acerca al dólar, la mayoría de las tareas está cayendo en el modelo caro por defecto.
💡 Tip: no mandes todas las tareas al modelo más caro por costumbre; medí costo por tarea antes de optimizar prompts.
Impacto y análisis de los modelos pequeños de ia
El efecto más directo es económico: bajar el costo de una tarea de investigación compleja de ~1 dólar a ~0,10 dólares cambia qué precio de suscripción es sostenible. Una app que antes necesitaba cobrar como un diario de negocios para no perder plata en cada consulta ahora puede acercarse a precios de consumo masivo.
El segundo efecto es organizacional. Reinhardt lo resume desde su experiencia manejando varias startups a la vez: la mayor parte del trabajo humano en una empresa no es genio técnico, es responder rápido y no soltar la pelota en docenas de frentes. Si los modelos pequeños de ia pueden asumir esa carga (agendar, dar seguimiento, resumir, redactar borradores), el cuello de botella deja de ser el talento IQ 180 y pasa a ser la infraestructura para delegarle tareas de negocio a un modelo con seguridad razonable.
Ahí aparece el trade-off honesto: delegar trabajo de negocio real a un modelo pequeño exige resolver primero problemas que la ia de consumo todavía no resolvió del todo, como la seguridad contra inyección de prompts, los permisos por rol y el arnés que decide qué puede hacer el modelo sin supervisión. French-Owen lo admite: falta trabajo de ingeniería antes de que rápido, barato y suficientemente bueno sea una realidad de negocio, no solo un experimento personal.
Qué sigue
French-Owen espera que la demanda por modelos de frontera, como Fable 5 y GPT-5.6 Sol, siga creciendo en paralelo, sobre todo en campos que dependen de descubrimientos genuinos: ingeniería avanzada, ciencia dura, entrenamiento de nuevos modelos. Pero también espera que la demanda por modelos rápidos, baratos y suficientemente buenos recién esté despegando, empujada por casos de uso de negocio más que por casos de uso de consumidor final.
La pieza que falta, según su propio planteo, no es más capacidad de modelo: es la infraestructura de seguridad y permisos para que una empresa confíe en darle a un modelo pequeño acceso a su correo, su CRM o su calendario sin supervisión constante.
Probalo vos: si tenés acceso a la API de algún modelo pequeño reciente, corré el mismo experimento de French-Owen (pedirle que investigue tu actividad pública y arme un resumen diario) y medí cuánto te cobra por ejecución.
📖 Resumen en Telegram: Ver resumen
Preguntas frecuentes
¿Qué es gpt-5.6-luna?
Es un modelo de lenguaje pequeño y rápido que Calvin French-Owen, cofundador de Segment, probó durante varias semanas. Según su reporte, procesa alrededor de 100 tokens por segundo y resuelve tareas de investigación complejas por centavos de dólar.
¿Por qué los modelos pequeños de ia son importantes para construir apps?
Porque determinan si un producto de consumo con ia es económicamente viable. Con modelos caros, una consulta compleja podía costar cerca de 1 dólar, un costo insostenible para una suscripción de 30 dólares al mes. Con modelos pequeños ese costo puede bajar a centavos.
¿GLM 5.3 es lo mismo que gpt-5.6-luna?
No, son modelos distintos de proveedores distintos. Lo que tienen en común, según datos de artificialanalysis.ai, es que ambos aparecen en la frontera de Pareto costo-capacidad: ofrecen buena relación entre lo que cuestan y lo que resuelven.
¿Los modelos pequeños de ia reemplazan a los modelos de frontera como Fable 5?
No para todos los casos. French-Owen sigue usando los modelos más caros y capaces para programación compleja, donde hace falta una solución novedosa. Los modelos pequeños apuntan a tareas repetitivas y de alto volumen, no a los problemas más difíciles.
¿Qué falta para que las empresas deleguen tareas de negocio a modelos pequeños sin supervisión?
Según French-Owen, falta resolver la seguridad contra inyección de prompts, definir roles y permisos claros, y construir el arnés que decida qué puede ejecutar el modelo de forma autónoma.
¿Cuánto cuesta el experimento del micrositio de noticias personalizado?
Con modelos clase Sonnet costaba cerca de 1 dólar por ejecución. Con gpt-5.6-luna, French-Owen reporta un costo promedio de unos 0,10 dólares por ejecución.
Referencias
- Small Models Have Arrived: artículo original de Calvin French-Owen que documenta el costo y la velocidad de gpt-5.6-luna.
- Artificial Analysis: gráfico de la frontera de Pareto costo-capacidad que ubica a GLM 5.3 entre los modelos más eficientes.
- Small language model (Wikipedia): contexto general sobre modelos de lenguaje pequeños y sus casos de uso.
📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.
Imagen destacada: Foto de BoliviaInteligente en Unsplash
0 Comentarios