⏱️ Lectura: 13 min
ConvAI Innovations lanzó Laya, un motor de decisiones que responde en 32,8 milisegundos por consulta en una sola GPU, y en 7,2 milisegundos por pregunta si el tráfico llega en lote. La empresa, liderada por Nandakishor Mukkunnoth, publicó el modelo completo bajo licencia Apache 2.0 semanas después de que TypeSafe AI presentara Jev, un producto comercial cerrado con una arquitectura no autoregresiva casi idéntica a la que Mukkunnoth ya había descrito en un paper de marzo de 2025.
📑 En este artículo
TL;DR
- ConvAI Innovations lanzó Laya, un motor de decisiones IA que responde en 32,8 milisegundos por consulta en una sola GPU.
- Procesado en lote, Laya resuelve una pregunta en 7,2 milisegundos, entre 6 y 8 veces más rápido que Jev, de TypeSafe AI.
- TypeSafe AI, fundada por Diogo Almeida (cocreador de ChatGPT), lanzó Jev en septiembre de 2026 sin papers ni pesos abiertos.
- Nandakishor Mukkunnoth, fundador de ConvAI, ya había publicado esta idea en marzo de 2025 en el paper arXiv:2503.23303.
- Jev cobra 0,042 dólares por millón de tokens de entrada y responde en unos 150 milisegundos, según el anuncio original.
- Los tres checkpoints de Laya (laya, laya-multilingual y laya-typed-decisions) están unificados en un solo repositorio de Hugging Face.
- Laya soporta más de 100 idiomas y se publica bajo licencia Apache 2.0, sin costo de suscripción a una API.
- El checkpoint laya-typed-decisions alcanza 0,766 de precisión en observabilidad de agentes y procesamiento de facturas.
Introducción
Todo pipeline de inteligencia artificial actual arrastra un mismo problema: usar un modelo generativo gigante para tomar una decisión binaria. Cuando llega un ticket de soporte, un correo sospechoso o un prompt de usuario, la pregunta real casi siempre es simple. ¿A qué área lo enrutamos? ¿Es phishing o spam? ¿Qué tan urgente es en una escala de 0 a 3? Convocar a un modelo de 8, 70 o cientos de miles de millones de parámetros para responder eso implica esperar entre 500 y 2.000 milisegundos, pagar por cada token generado y después escribir un parser de regex o JSON para extraer una etiqueta limpia de un texto libre.
Laya ataca ese problema desde otro ángulo. En lugar de generar texto, produce directamente una probabilidad calibrada sobre un esquema que vos definís de antemano. La compañía lo describe como un sistema de decisión tipo System 1, la reacción rápida e instintiva, en contraposición al razonamiento lento tipo System 2 que sí necesitan los modelos generativos grandes.
Qué pasó
El 19 de septiembre de 2026, ConvAI Innovations publicó en su sitio laya.convaiinnovations.com el anuncio completo de Laya junto con los pesos, el código y la documentación técnica. El lanzamiento llega con un tono particular. Mukkunnoth escribe que pasó meses de trabajo, publicó un paper en arXiv, liberó los pesos en Hugging Face y armó un paquete de PyPI en marzo de 2025, y que ahora ve una idea casi calcada presentada como avance por un laboratorio con financiamiento de gran escala.
Ese laboratorio es TypeSafe AI, fundado por Diogo Almeida, quien participó como cocreador de ChatGPT en OpenAI. TypeSafe lanzó en septiembre de 2026 un producto llamado Jev que ofrece la misma idea central, predicciones de probabilidad no autoregresivas sobre esquemas estructurados, pero como servicio cerrado: sin papers técnicos, sin pesos abiertos y sin datasets públicos, a 0,042 dólares por millón de tokens de entrada y con tiempos de respuesta cercanos a los 150 milisegundos.
La respuesta de ConvAI fue publicar una familia completa y abierta. Laya corre en 32,8 milisegundos en una GPU, según el benchmark que la propia empresa publicó junto con el lanzamiento, entre 6 y 8 veces más rápido que Jev, con soporte para más de 100 idiomas, sin costo de suscripción a una API y con pesos Apache 2.0 descargables desde hoy.
Contexto e historia
La primera versión de esta idea no nació en 2026. En marzo de 2025, Mukkunnoth publicó el paper arXiv:2503.23303, donde entrenaba un modelo no autoregresivo con PPO (Proximal Policy Optimization) sobre representaciones de secuencia para predecir trayectorias de conversión turno por turno en conversaciones de ventas SaaS, con salidas entre 0.0 y 1.0. Junto al paper liberó el modelo sales-conversion-model-reinf-learning en Hugging Face, el dataset abierto saas-sales-conversations, un paquete de PyPI y una discusión pública en r/LocalLLaMA.
En septiembre de 2025 llegó un segundo paper, arXiv:2510.01237, que formalizaba el marco general para decisiones basadas en esquemas guiadas por aprendizaje por refuerzo. El eje del sistema, en ambos papers, siempre fue el refuerzo, no un modelo de embeddings ni un LLM autoregresivo disfrazado de clasificador.
Un año después llegó Jev. Según cuenta Mukkunnoth, TypeSafe generalizó el mismo concepto de muestreo paralelo no autoregresivo, lo llamó RLCD (Reinforcement Learning for Calibrated Decisions) y lo empaquetó como servicio comercial. Laya adopta esa misma sigla para describir su propio entrenamiento, lo que sugiere que ambos equipos convergieron en un nombre parecido para una idea con genealogía pública desde 2025.
Detalles técnicos y rendimiento del motor de decisiones
Laya evalúa preguntas tipadas sobre cualquier estado (texto libre, un correo, un ticket, un documento JSON) en un único forward pass, sin generar ni un token de texto. Todo el espacio de salida se reduce a tres primitivas:
- choice: elige una opción de un diccionario de criterios y devuelve la clave seleccionada, la distribución de probabilidad sobre todas las opciones y un puntaje de confianza calibrado.
- score: ubica el estado en una rúbrica ordinal (niveles 0, 1, 2…) y devuelve el nivel esperado junto con la distribución sobre esos rangos.
- noul: responde una pregunta booleana directa con la probabilidad calibrada P(verdadero), donde P(falso) = 1 – P(verdadero) por construcción.
El flujo completo, de la entrada a la probabilidad calibrada, es directo:
flowchart TD
A["Texto de entrada (ticket, correo, prompt)"] --> B["Laya (encoder bidireccional)"]
B --> C{"Primitiva"}
C --> D["choice: elegir opcion"]
C --> E["score: nivel en rubrica"]
C --> F["noul: probabilidad P(verdadero)"]
D --> G["Salida calibrada, sin texto libre"]
E --> G
F --> G
Como el espacio de salida es puramente numérico, Laya no puede alucinar una cadena de texto ni devolver JSON malformado, estructuralmente no existe forma de que eso pase. Eso es distinto de pedirle a un LLM generativo que devuelva "confidence: 0.95", un número que en ese caso es solo el token más probable a continuación, sin ninguna garantía matemática de calibración detrás.
La familia se reparte en tres checkpoints especializados, unificados hoy en un único repositorio de Hugging Face:
| Checkpoint | Backbone | Parámetros | Contexto | Fortaleza principal |
|---|---|---|---|---|
| convaiinnovations/laya | ModernBERT-large | 421M | 512 tokens | Clasificación de texto en inglés, guardrails, triage de correo |
| convaiinnovations/laya-multilingual | mmBERT-base (vocab 256k) | 322M | 1024 (hasta 8k) | 100+ idiomas, NLI entre idiomas, 2,2x más rápido |
| convaiinnovations/laya-typed-decisions | ModernBERT-large | 421M | 1024 tokens | Observabilidad de agentes, atención al cliente, facturas (0,766 de precisión) |
El paper que acompaña el lanzamiento incluye un tablero de benchmarks con precisión sobre datasets compartidos, nueve flujos de aplicación distintos, un barrido de 51 idiomas y latencia medida en una T4, además de una prueba de reparación de calibración. Antes, cada checkpoint vivía en un repositorio separado y sumaba 2,5 GB combinados si alguien quería los tres; ahora, un solo repositorio los agrupa con subcarpetas descargables por separado.
Cómo empezar
Los tres checkpoints se descargan desde el mismo repositorio de Hugging Face usando huggingface_hub. El proceso de instalación es idéntico en Windows, macOS y Linux porque corre sobre Python; lo único que cambia es cómo activás el entorno virtual.
# Linux / macOS
python3 -m venv .venv
source .venv/bin/activate
pip install transformers torch huggingface_hub
# Windows (PowerShell)
python -m venv .venv
.venv\Scripts\Activate.ps1
pip install transformers torch huggingface_hub
Con el entorno listo, podés bajar solo el checkpoint que te interesa en vez de arrastrar los 2,5 GB combinados. Usando allow_patterns de huggingface_hub apuntás directo a la subcarpeta multilingüe:
from huggingface_hub import snapshot_download
local_path = snapshot_download(
repo_id="convaiinnovations/laya",
allow_patterns=["laya-multilingual/*"],
local_dir="./laya-multilingual"
)
print("Checkpoint descargado en:", local_path)
Para confirmar que bajaste solo lo que pediste, y no los tres checkpoints completos, revisá el tamaño de la carpeta antes de cargar el modelo en memoria:
# Linux / macOS
du -sh ./laya-multilingual
# Windows (PowerShell)
Get-ChildItem -Recurse .\laya-multilingual | Measure-Object -Property Length -Sum
Si el tamaño ronda los cientos de megabytes en vez de gigabytes, el filtro de subcarpeta funcionó. A partir de ahí, cargar el modelo y correr una primitiva choice es cuestión de instanciar el tokenizer y el encoder con la API estándar de transformers, y mapear la salida a las claves de tu esquema.
💡 Tip: si tu caso de uso es enrutar tickets de soporte en español, empezá por laya-multilingual: es el único de los tres checkpoints con evaluación explícita de NLI entre idiomas y contexto extendido hasta 8k tokens.
Impacto y análisis
El caso de Laya expone una tensión que se repite seguido en investigación de inteligencia artificial. Un equipo chico publica una idea de motor de decisiones con paper, pesos y dataset abiertos; años o meses después, un laboratorio con más financiamiento presenta una variante cerrada de la misma idea con mejor empaquetado, sin citar el trabajo previo. Mukkunnoth documenta la cronología con fechas y enlaces verificables, lo que convierte esto en un caso con evidencia pública, no solo en una queja subjetiva.
Para quien construye agentes o pipelines de producción, el punto práctico importa más que la disputa de prioridad. Laya no reemplaza a un LLM generativo, le saca del camino las decisiones triviales (enrutar, clasificar, puntuar) que hoy muchos equipos siguen resolviendo con un modelo de cientos de miles de millones de parámetros. Eso baja la latencia de la ruta crítica y elimina el costo de token por cada micro-decisión.
El diferencial de costo entre Laya y Jev también es concreto. Jev cobra 0,042 dólares por millón de tokens de entrada con respuestas de unos 150 milisegundos; Laya corre local, sin llamadas a una API externa, con licencia Apache 2.0 y sin límite de uso más allá del hardware disponible.
Dicho esto, Laya tiene límites reales. El checkpoint laya-typed-decisions reporta 0,766 de precisión en observabilidad de agentes y procesamiento de facturas, un número lejos de la perfección para decisiones de alto riesgo. Y como es un modelo discriminativo, necesitás definir de antemano el esquema completo (las opciones de choice, los niveles de score) antes de correrlo: no sirve para tareas abiertas donde ni vos sabés todavía cuáles son las categorías posibles.
⚠️ Ojo: con 0,766 de precisión en el checkpoint de decisiones tipadas, conviene mantener revisión humana en las decisiones de alto riesgo, no delegar directo a Laya sin ningún control posterior.
Qué sigue
ConvAI dice haber corregido, con Laya, las limitaciones arquitectónicas de su primer modelo de 2025: pasó de una salida vertical especializada en conversión de ventas a una familia horizontal que cubre cualquier esquema de decisión, con soporte multilingüe real vía mmBERT-base. El repositorio unificado en Hugging Face y la licencia Apache 2.0 abren la puerta a que terceros repliquen o auditen las cifras que la empresa publicó junto al lanzamiento, algo que hoy no es posible con Jev por no tener papers ni pesos públicos.
Lo que queda por ver es si TypeSafe AI responde con documentación técnica propia o si el mercado de decisiones tipo System 1 termina dividido entre una oferta cerrada y de pago y una alternativa abierta con genealogía académica pública desde 2025. Para equipos que hoy resuelven triage, moderación o enrutamiento con un LLM generativo, la comparación entre ambos ya está sobre la mesa: 32,8 milisegundos y pesos propios contra 150 milisegundos y una API cerrada.
Probalo vos: corré pip install huggingface_hub y descargá el checkpoint laya-multilingual con el snippet de arriba para ver la latencia real en tu propio hardware hoy mismo.
📖 Resumen en Telegram: Ver resumen
Preguntas frecuentes
¿Qué es un motor de decisiones tipo System 1?
Es un modelo que responde preguntas estructuradas y simples (elegir una opción, puntuar en una escala, responder sí o no) en un solo forward pass, sin generar texto libre, inspirado en la distinción de Kahneman entre pensamiento rápido (System 1) y pensamiento lento y deliberado (System 2).
¿En qué se diferencia Laya de un LLM generativo?
Un LLM generativo produce texto token por token y necesita que vos parsees la respuesta para extraer una etiqueta. Laya devuelve directamente una probabilidad calibrada o una clave de un diccionario cerrado de opciones, en 32,8 milisegundos por consulta según el benchmark de ConvAI, sin posibilidad de devolver una salida malformada.
¿Laya funciona en español?
Sí, a través del checkpoint convaiinnovations/laya-multilingual, construido sobre mmBERT-base con vocabulario de 256.000 tokens y soporte declarado para más de 100 idiomas.
¿Laya usa el mismo RLCD que Jev?
ConvAI describe a Laya como un motor entrenado con refuerzo y distribución calibrada, la misma sigla RLCD que después adoptó TypeSafe AI para Jev. La diferencia, según Mukkunnoth, no está en el nombre sino en que la ruta de Laya se puede auditar: papers públicos desde marzo de 2025, pesos descargables y un dataset abierto.
¿Cuánto cuesta usar Laya frente a Jev?
Laya corre local bajo licencia Apache 2.0 sin costo de API. Jev, en cambio, cobra 0,042 dólares por millón de tokens de entrada con tiempos de respuesta cercanos a los 150 milisegundos, según el anuncio de lanzamiento de TypeSafe AI citado por ConvAI.
¿Dónde se descargan los pesos de Laya?
Los tres checkpoints están unificados en un único repositorio de Hugging Face bajo la cuenta convaiinnovations, con subcarpetas descargables por separado usando allow_patterns de huggingface_hub.
Referencias
- laya.convaiinnovations.com: anuncio oficial de Laya, con el tablero completo de benchmarks.
- arXiv:2503.23303: paper original de marzo de 2025 sobre trayectorias de conversión con RL no autoregresivo.
- arXiv:2510.01237: segundo paper, de septiembre de 2025, que formaliza el marco de decisiones por esquema guiadas por RL.
- huggingface.co/convaiinnovations: repositorio con los tres checkpoints de Laya.
- r/LocalLLaMA: comunidad donde ConvAI discutió por primera vez el enfoque en 2025.
📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.
0 Comentarios