⏱️ Lectura: 13 min

Calvin French-Owen, cofundador de Segment, llevó semanas probando gpt-5.6-luna, un modelo de ia liviano y rápido. En una prueba le pidió que revisara miles de sus correos electrónicos en busca de patrones: la factura final rondó los diez centavos de dólar. Ese número, no la inteligencia del modelo, es la noticia.

📑 En este artículo
  1. TL;DR
  2. Introducción
  3. Qué pasó
  4. Contexto e historia
  5. Detalles técnicos y rendimiento
  6. Cómo probarlo
  7. Impacto y análisis de los modelos pequeños de ia
  8. Qué sigue
  9. Preguntas frecuentes
    1. ¿Qué es gpt-5.6-luna?
    2. ¿Por qué los modelos pequeños de ia son importantes para construir apps?
    3. ¿GLM 5.3 es lo mismo que gpt-5.6-luna?
    4. ¿Los modelos pequeños de ia reemplazan a los modelos de frontera como Fable 5?
    5. ¿Qué falta para que las empresas deleguen tareas de negocio a modelos pequeños sin supervisión?
    6. ¿Cuánto cuesta el experimento del micrositio de noticias personalizado?
  10. Referencias

Durante dos años la conversación sobre ia giró en torno a qué tan lejos podían llegar los modelos más grandes y caros. Ahora hay una segunda historia, más silenciosa: los modelos pequeños de ia ya son lo bastante buenos y baratos para sostener productos completos, no solo demos.

TL;DR

  • gpt-5.6-luna procesa cerca de 100 tokens por segundo en uso real, según Calvin French-Owen, cofundador de Segment.
  • Una tarea de investigación compleja con gpt-5.6-luna, como revisar miles de correos, cuesta apenas centavos de dólar.
  • Con modelos clase Sonnet (generación anterior), la misma tarea rondaba 1 dólar por ejecución.
  • GLM 5.3 entra a la frontera de Pareto costo-capacidad junto a gpt-5.6-luna, según artificialanalysis.ai.
  • Un micrositio de noticias personalizado diario bajó de ~1 dólar a ~0,10 dólares por ejecución con gpt-5.6-luna.
  • Para programación compleja, French-Owen sigue prefiriendo modelos caros como Fable 5 y GPT-5.6 Sol.
  • Peter Reinhardt (Charm Industrial, Revoy) estima que el 95% de su trabajo diario es tarea repetitiva, no genio técnico.

Introducción

La discusión pública sobre modelos de lenguaje giró durante años en torno a la capacidad: qué modelo razona mejor, cuál programa sin errores, cuál resuelve matemáticas de nivel olímpico. Ese eje sigue existiendo, pero apareció un segundo eje tan relevante como el primero: el costo por tarea. Calvin French-Owen documentó en su blog la experiencia de usar gpt-5.6-luna, un modelo pequeño y veloz que, según él, resuelve tareas complejas de investigación por centavos de dólar.

El cambio no es solo técnico, modifica qué tipo de producto de ia es viable construir. Durante la era de los modelos clase Sonnet, ejecutar una consulta compleja podía costar alrededor de 1 dólar. Cobrar 30 dólares al mes por una app de consumo con ese costo de inferencia era, en palabras de French-Owen, insostenible.

Qué pasó

French-Owen pasó varias semanas probando gpt-5.6-luna en tareas cotidianas: revisar su código, su correo y su base de conocimiento personal. Reporta velocidades de alrededor de 100 tokens por segundo y facturas de API de apenas centavos de dólar, incluso al hacer que el modelo busque patrones en miles de correos electrónicos.

El punto de comparación que usa es un experimento personal que repite cada cierto tiempo: pedirle a un modelo que investigue su actividad pública, entienda qué noticias podrían interesarle y arme un micrositio diario personalizado con lo más relevante de Hacker News, Reddit y Twitter. Con la generación anterior de modelos clase Sonnet, ese experimento costaba cerca de 1 dólar por ejecución. Con gpt-5.6-luna, el costo promedio bajó a unos 0,10 dólares.

En paralelo, artificialanalysis.ai ubicó a GLM 5.3 en la frontera de Pareto costo-capacidad, es decir, entre los modelos con mejor relación entre lo que cuestan y lo que resuelven. French-Owen aclara que para programación sigue prefiriendo modelos más caros y capaces, como Fable 5 y GPT-5.6 Sol, pero admite que esa preferencia le hizo perder de vista el avance de los modelos pequeños.

Contexto e historia

El manual clásico de una empresa de consumo masivo, previo a la ia generativa, fue simple durante dos décadas: construir un sitio barato de operar, conseguir usuarios con algo de viralidad, levantar capital para escalar y, eventualmente, montar un mercado de publicidad. Google, Facebook y Snapchat siguieron ese camino, con Amazon y Netflix como las excepciones que French-Owen señala.

Agregar ia generativa a ese modelo rompe el primer paso: ya no alcanza con un sitio barato de operar, porque cada respuesta de un modelo grande implica un costo de inferencia real por usuario. Eso explica, según inversores citados por French-Owen, por qué no surgieron más startups de ia de consumo pese a dos años de inversión récord en el sector: el costo por token todavía no bajaba lo suficiente como para sostener un precio de suscripción razonable.

Los modelos pequeños de ia cambian esa cuenta. No compiten por el primer puesto en los benchmarks de razonamiento, compiten por ser lo bastante buenos a una fracción del costo, y esa fracción es la que determina si un producto de consumo con ia es viable a escala.

Comparación de costo entre modelos de ia grandes y pequeños
De ~1 dólar a ~0,10 dólares por tarea, según French-Owen. Foto de Gabriele Malaspina en Unsplash

Detalles técnicos y rendimiento

La cifra que French-Owen repite es la velocidad: ~100 tokens por segundo en uso real con gpt-5.6-luna, suficiente para que la latencia deje de sentirse como una espera y empiece a sentirse como una conversación. La velocidad importa tanto como el costo, porque un modelo lento, aunque barato, sigue siendo inviable para productos interactivos.

En el otro extremo de la frontera de capacidad están los modelos que French-Owen reserva para programar: Fable 5 y GPT-5.6 Sol. Son los que usa para lo que su excompañero de Segment, Peter Reinhardt, describe como trabajo IQ 180: un puñado de problemas donde hace falta una solución novedosa que nadie pensó antes. El resto (que Reinhardt estima en el 95% del trabajo que hace al manejar varias empresas, entre ellas Charm Industrial y Revoy) es lo que llama trabajo token spewer: responder rápido, coordinar personas, avanzar en paralelo en decenas de frentes.

💭 Clave: Reinhardt levantó más de 100 millones de dólares para Charm Industrial y cerró una serie A para Revoy, y aun así calcula que el 95% de su trabajo diario no requiere genio técnico, requiere responder rápido.

Esa distinción importa para elegir modelo en un pipeline real. No todas las llamadas a un LLM necesitan el modelo más caro disponible, y tratarlas todas igual desperdicia el ahorro que ofrecen los modelos pequeños de ia.

Modelo o claseUso típicoCosto aproximado por tarea complejaLimitación
gpt-5.6-lunaInvestigación diaria, correo, base de conocimientoCentavos de dólar (~0,10 en el eval de French-Owen)No es el modelo elegido para programación difícil
Modelos clase Sonnet (generación anterior)Investigación compleja~1 dólar por tareaInsostenible para una suscripción de consumo de 30 dólares/mes
Fable 5 / GPT-5.6 SolProgramación compleja, problemas IQ 180Alto, no es el foco del ahorroFrontera de capacidad, no de costo
GLM 5.3Trabajo general y agenticNuevo punto en la frontera de Pareto costo-capacidadDatos de rendimiento aún limitados a artificialanalysis.ai

Cómo probarlo

Para replicar el experimento del micrositio de noticias personalizado, la arquitectura mínima es sencilla: un paso de investigación (buscar en HN, Reddit y menciones públicas del usuario), un paso de síntesis (elegir qué importa) y un paso de generación (armar el resumen). El ahorro no está en el código, está en enrutar cada paso al modelo correcto según su costo.

Un llamado mínimo usando una API compatible con el formato que hoy soportan la mayoría de proveedores de modelos chicos se ve así:

curl https://api.ejemplo-proveedor.com/v1/chat/completions \
 -H "Authorization: Bearer $API_KEY" \
 -H "Content-Type: application/json" \
 -d '{
 "model": "modelo-pequeno-rapido",
 "messages": [
 {"role": "system", "content": "Sos un investigador que resume noticias tech."},
 {"role": "user", "content": "Busca las noticias mas relevantes de hoy en HN y Reddit para un desarrollador backend."}
 ],
 "max_tokens": 800
 }'

Esa llamada devuelve un resumen en segundos y, con un modelo pequeño, a un costo de centavos por ejecución.

Para enrutar automáticamente entre un modelo barato y uno caro según la complejidad de la tarea, un patrón habitual en producción es decidir el modelo antes de llamar, no después:

function elegirModelo(tarea) {
 const esCompleja = tarea.requiereRazonamientoProfundo || tarea.tokensEstimadosSalida > 4000;
 return esCompleja ? "modelo-frontera-caro" : "modelo-pequeno-rapido";
}

async function ejecutarTarea(tarea) {
 const modelo = elegirModelo(tarea);
 const respuesta = await llamarLLM(modelo, tarea.prompt);
 console.log(`Modelo usado: ${modelo}, tokens de salida: ${respuesta.usage.completion_tokens}`);
 return respuesta;
}

El siguiente diagrama resume ese enrutamiento:

flowchart TD
 A["Tarea entrante"] --> B{"Es compleja?"}
 B -- "No" --> C["Modelo pequeño y rápido"]
 B -- "Si" --> D["Modelo de frontera, caro"]
 C --> E["Respuesta al usuario"]
 D --> E

Para confirmar que el enrutamiento funciona como se espera, lo más simple es loguear el modelo usado y el costo estimado por llamada (la mayoría de proveedores devuelve el conteo de tokens de entrada y salida en la misma respuesta) y sumarlo por día. Si el costo promedio por tarea se acerca a los centavos de dólar que reporta French-Owen para gpt-5.6-luna, el pipeline está bien enrutado. Si se acerca al dólar, la mayoría de las tareas está cayendo en el modelo caro por defecto.

💡 Tip: no mandes todas las tareas al modelo más caro por costumbre; medí costo por tarea antes de optimizar prompts.

Impacto y análisis de los modelos pequeños de ia

El efecto más directo es económico: bajar el costo de una tarea de investigación compleja de ~1 dólar a ~0,10 dólares cambia qué precio de suscripción es sostenible. Una app que antes necesitaba cobrar como un diario de negocios para no perder plata en cada consulta ahora puede acercarse a precios de consumo masivo.

El segundo efecto es organizacional. Reinhardt lo resume desde su experiencia manejando varias startups a la vez: la mayor parte del trabajo humano en una empresa no es genio técnico, es responder rápido y no soltar la pelota en docenas de frentes. Si los modelos pequeños de ia pueden asumir esa carga (agendar, dar seguimiento, resumir, redactar borradores), el cuello de botella deja de ser el talento IQ 180 y pasa a ser la infraestructura para delegarle tareas de negocio a un modelo con seguridad razonable.

Ahí aparece el trade-off honesto: delegar trabajo de negocio real a un modelo pequeño exige resolver primero problemas que la ia de consumo todavía no resolvió del todo, como la seguridad contra inyección de prompts, los permisos por rol y el arnés que decide qué puede hacer el modelo sin supervisión. French-Owen lo admite: falta trabajo de ingeniería antes de que rápido, barato y suficientemente bueno sea una realidad de negocio, no solo un experimento personal.

Flujo de trabajo delegado a un modelo pequeño de ia en una empresa
El 95% del trabajo de Reinhardt es responder rápido, no resolver problemas IQ 180. Foto de Markus Winkler en Unsplash

Qué sigue

French-Owen espera que la demanda por modelos de frontera, como Fable 5 y GPT-5.6 Sol, siga creciendo en paralelo, sobre todo en campos que dependen de descubrimientos genuinos: ingeniería avanzada, ciencia dura, entrenamiento de nuevos modelos. Pero también espera que la demanda por modelos rápidos, baratos y suficientemente buenos recién esté despegando, empujada por casos de uso de negocio más que por casos de uso de consumidor final.

La pieza que falta, según su propio planteo, no es más capacidad de modelo: es la infraestructura de seguridad y permisos para que una empresa confíe en darle a un modelo pequeño acceso a su correo, su CRM o su calendario sin supervisión constante.

Probalo vos: si tenés acceso a la API de algún modelo pequeño reciente, corré el mismo experimento de French-Owen (pedirle que investigue tu actividad pública y arme un resumen diario) y medí cuánto te cobra por ejecución.

📖 Resumen en Telegram: Ver resumen

Preguntas frecuentes

¿Qué es gpt-5.6-luna?

Es un modelo de lenguaje pequeño y rápido que Calvin French-Owen, cofundador de Segment, probó durante varias semanas. Según su reporte, procesa alrededor de 100 tokens por segundo y resuelve tareas de investigación complejas por centavos de dólar.

¿Por qué los modelos pequeños de ia son importantes para construir apps?

Porque determinan si un producto de consumo con ia es económicamente viable. Con modelos caros, una consulta compleja podía costar cerca de 1 dólar, un costo insostenible para una suscripción de 30 dólares al mes. Con modelos pequeños ese costo puede bajar a centavos.

¿GLM 5.3 es lo mismo que gpt-5.6-luna?

No, son modelos distintos de proveedores distintos. Lo que tienen en común, según datos de artificialanalysis.ai, es que ambos aparecen en la frontera de Pareto costo-capacidad: ofrecen buena relación entre lo que cuestan y lo que resuelven.

¿Los modelos pequeños de ia reemplazan a los modelos de frontera como Fable 5?

No para todos los casos. French-Owen sigue usando los modelos más caros y capaces para programación compleja, donde hace falta una solución novedosa. Los modelos pequeños apuntan a tareas repetitivas y de alto volumen, no a los problemas más difíciles.

¿Qué falta para que las empresas deleguen tareas de negocio a modelos pequeños sin supervisión?

Según French-Owen, falta resolver la seguridad contra inyección de prompts, definir roles y permisos claros, y construir el arnés que decida qué puede ejecutar el modelo de forma autónoma.

¿Cuánto cuesta el experimento del micrositio de noticias personalizado?

Con modelos clase Sonnet costaba cerca de 1 dólar por ejecución. Con gpt-5.6-luna, French-Owen reporta un costo promedio de unos 0,10 dólares por ejecución.

Referencias

📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.

Imagen destacada: Foto de BoliviaInteligente en Unsplash


Andrés Morales

Desarrollador e investigador en inteligencia artificial. Escribe sobre modelos de lenguaje, frameworks, herramientas para devs y lanzamientos open source. Cubre papers de ML, ecosistema de startups tech y tendencias de programación.

0 Comentarios

Deja un comentario

Marcador de posición del avatar

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.