⏱️ Lectura: 12 min

Un modelo que activa apenas el 4,4% de sus propios parámetros en cada token acaba de salir de Alemania con licencia abierta. Se llama Aleph Alpha Kolibri, lo lanzó la compañía alemana Aleph Alpha el 3 de octubre de 2026, y combina 78.100 millones de parámetros totales con una arquitectura de mezcla de expertos entrenada íntegramente en infraestructura europea.

📑 En este artículo
  1. TL;DR
  2. Qué es Aleph Alpha Kolibri
  3. Qué pasó
  4. Contexto e historia
  5. Detalles técnicos
  6. Impacto y análisis
  7. Qué sigue
  8. Preguntas frecuentes
    1. ¿Qué significa que Aleph Alpha Kolibri sea un modelo soberano?
    2. ¿Cuántos parámetros activa Kolibri por cada token?
    3. ¿Qué licencia tiene el LLM soberano alemán?
    4. ¿El sistema de mezcla de expertos de Kolibri necesita menos memoria que un modelo denso equivalente?
    5. ¿Por qué el tokenizador de Kolibri es relevante para hablantes de alemán?
  9. Referencias
    1. 📚 Artículos relacionados

El lanzamiento llega acompañado de un informe técnico de 189 páginas y una licencia Apache 2.0 para los pesos, justo cuando Europa discute cómo competir en inteligencia artificial sin depender de infraestructura estadounidense o china.

TL;DR

  • Aleph Alpha lanzó Kolibri el 3 de octubre de 2026, LLM alemán de 78.100 millones de parámetros.
  • El modelo activa solo 3.460 millones de parámetros por token (4,4%) gracias a su mezcla de expertos.
  • Se entrenó con 24 billones de tokens en 768 GPU NVIDIA B200, ubicadas en Alemania y Finlandia.
  • Su tokenizador UniBPE recorta 11,2% los tokens necesarios para alemán frente al de GPT-5.
  • La compañía firmó el Código de Buenas Prácticas de Modelos de IA de Propósito General de la UE.

Qué es Aleph Alpha Kolibri

Aleph Alpha Kolibri es un modelo de lenguaje de pesos abiertos en alemán e inglés, con una arquitectura de mezcla de expertos de 78.100 millones de parámetros totales que activa solo 3.460 millones por token, publicado bajo licencia Apache 2.0 y diseñado para cumplir el Reglamento de IA europeo desde su origen.

El nombre no es casual: Kolibri significa colibrí en alemán, un guiño a un modelo cuyo mérito principal es pesar poco en cómputo aunque cargue con una memoria considerable. Según el model card publicado en Hugging Face, el modelo soporta razonamiento en cuatro niveles (ninguno, bajo, medio y alto), llamadas a herramientas, y tiene un corte de conocimiento al 18 de junio de 2026.

Qué pasó

Aleph Alpha, con sede en Heidelberg, presentó Kolibri el 3 de octubre de 2026 junto a un post de lanzamiento, una ficha técnica de 189 páginas y los pesos en Hugging Face. En ese post, la compañía describe el modelo con una palabra que repite varias veces: «sovereign». En sus propias palabras, citadas en el análisis técnico publicado en tej.as, «teams built the model in Germany, trained it on infrastructure in Germany and Finland, under European and German law, with no foreign control».

Esa soberanía tiene dos caras, según el mismo post. La primera es el proceso: equipos alemanes, infraestructura en Alemania y Finlandia, ley europea. La segunda es lo que recibe el cliente: libertad total de despliegue y seguridad de propiedad intelectual, de modo que el cumplimiento normativo queda incorporado por diseño y no depende de un proveedor externo que pueda cambiar o apagar el modelo. Aleph Alpha también firmó el Código de Buenas Prácticas de IA de Propósito General de la Unión Europea, el marco voluntario que acompaña al Reglamento de IA para modelos de uso general.

En la evaluación interna de Aleph Alpha, Kolibri queda por encima de todos los modelos comparables de su tamaño en alemán e inglés. Es un dato que hay que leer con cautela: viene del propio fabricante, no de un benchmark independiente.

Contexto e historia

Aleph Alpha nació en 2019 como una de las apuestas europeas por construir modelos de lenguaje propios, en un ecosistema dominado por laboratorios estadounidenses y, más recientemente, chinos. La compañía ya había lanzado antes la familia Luminous, y Kolibri llega como un salto de arquitectura: de modelos densos a mezcla de expertos, con el foco puesto explícitamente en el cumplimiento regulatorio europeo desde el diseño y no como un parche posterior.

El debate de fondo no es nuevo. Un analista independiente que sigue la escena de IA europea documentó en su análisis que, en una conferencia de 2024, escuchó en Estados Unidos la frase «you regulate, you don’t innovate» al mencionar que vivía en Alemania. Kolibri funciona como una respuesta directa a esa crítica: un intento de demostrar que regulación y capacidad técnica no son mutuamente excluyentes.

Soberano no significa aislado. El model card de Kolibri admite que el texto en inglés usado para entrenar se reescribió con Gemma 4 de Google, el alemán con Mistral-NeMo, y que Qwen3-32B etiquetó datos para los filtros de calidad. Aleph Alpha además filtró el sesgo político que, según afirma, midieron en modelos abiertos chinos. La soberanía de Kolibri está en la infraestructura de entrenamiento, la ley aplicable y el control del modelo final, no en que cada byte de datos haya nacido en Europa.

Detalles técnicos

El mecanismo central de el LLM soberano alemán es la mezcla de expertos. Kolibri tiene 50 capas, cada una con 384 expertos más 1 experto compartido por el que pasa cada token. Un router decide, para cada token, a cuáles de los 384 expertos enviarlo: elige 6. Esa combinación de 6 expertos seleccionados más el experto compartido es lo que convierte 78.100 millones de parámetros totales en apenas 3.460 millones de cómputo real por token.

Kolibri se entrenó con 768 GPU NVIDIA B200 en centros de datos de Alemania y Finlandia. Foto de Hitesh Choudhary en Unsplash

El truco tiene un costo que el propio model card no esconde: «the full model must be held in memory even though only part of it is active at any time». Aunque el modelo computa como uno de 3.460 millones de parámetros, necesita la memoria de uno de 78.100 millones: alrededor de 78 GB en punto flotante de 8 bits (FP8). Es la razón por la que correr Kolibri localmente sigue exigiendo hardware serio, incluso cuando el gasto de cómputo por token es bajo.

flowchart TD
 A["Token de entrada"] --> B["Router"]
 B --> C["Experto compartido"]
 B --> D["6 de 384 expertos seleccionados"]
 C --> E["Salida combinada"]
 D --> E

El segundo mecanismo es el tokenizador. El alemán junta palabras en compuestos largos, y un tokenizador entrenado sobre todo con inglés los corta en pedazos poco útiles. Aleph Alpha entrenó un tokenizador propio, UniBPE, con 128.000 tokens de vocabulario: combina la fusión ascendente de byte-pair encoding (BPE) con una regla de puntuación distinta, el objetivo Unigram, que respeta mejor cómo se construyen las palabras en alemán.

o200k_base (GPT-5): Bund | es | ver | fass | ungs | gericht -> 6 tokens
Kolibri: Bundes | verfassungsgericht -> 2 tokens

Esa palabra es el nombre alemán del Tribunal Constitucional Federal. El tokenizador de GPT-4o y GPT-5 (o200k_base, vía tiktoken de OpenAI) la parte en 6 tokens; el de Kolibri la deja en 2. Según el informe técnico, citado en el análisis de tej.as, UniBPE necesita en promedio 11,2% menos tokens para procesar texto en alemán que el tokenizador de GPT-5, el mejor resultado entre los 9 tokenizadores que compararon.

Kolibri tiene contexto nativo de 262.144 tokens, probado hasta 1.048.576. Para confirmar ese valor sin depender de lo que el runtime de inferencia te deje forzar, conviene revisar directamente el archivo config.json del repositorio en Hugging Face y el campo que fija la longitud máxima de posición: ese número es el límite real de la arquitectura, no el que negocia el servidor que lo expone. Sobre los cuatro niveles de razonamiento, en cambio, no hay forma directa de verificar cuál está activo desde afuera: Aleph Alpha no publicó, a la fecha de este artículo, un endpoint público propio para Kolibri, así que el parámetro que controla el nivel depende de qué motor de inferencia use quien lo sirva.

Nivel de razonamiento Cuándo usarlo Ventaja Limitación
Ninguno Respuestas directas, tareas simples Latencia mínima Sin razonamiento explícito
Bajo Preguntas de uno o dos pasos lógicos Equilibrio costo y velocidad Puede fallar en problemas de varios pasos
Medio Tareas que requieren descomponer un problema Mejor precisión en tareas complejas Más tokens de salida, mayor costo
Alto Razonamiento largo, matemática, planificación Máxima precisión Mayor latencia y consumo de cómputo

Impacto y análisis

El sistema de pesos abiertos europeo resuelve un problema concreto para gobiernos y empresas reguladas: una ficha de salud, un diseño de pieza automotriz o un expediente administrativo puede entrar y salir de un servidor propio, bajo ley alemana, sin que un proveedor externo pueda cambiar el modelo bajo los pies del cliente. Para un ministerio o un proveedor del sector automotor europeo, eso pesa más que un punto porcentual de benchmark.

⚠️ Ojo: La comparación que ubica a Kolibri por delante de otros modelos de su tamaño es una evaluación interna de Aleph Alpha, publicada en su propio informe técnico. Todavía no hay benchmarks independientes que confirmen esos resultados.

El costo de memoria, sin embargo, le pone un techo real a esa promesa de soberanía fácil. Un modelo que necesita 78 GB en memoria para activar solo 3.460 millones de parámetros por token no corre en una laptop ni en un servidor modesto: sigue exigiendo GPU de clase centro de datos, aunque el gasto de cómputo por consulta sea bajo. La soberanía de datos no equivale a soberanía de hardware accesible.

También queda la tensión entre el discurso y la práctica de datos. El model card es transparente al admitir que usó Gemma 4 de Google y Mistral-NeMo para reescribir texto de entrenamiento, y Qwen3-32B para etiquetar datos de filtrado. Un modelo que se presenta como garantía de independencia frente a infraestructura no europea usó, en su propio proceso de curación, modelos de Google, Mistral y un laboratorio chino. No invalida el logro técnico, pero sí matiza qué tan limpia es la frontera entre «soberano» y «con ayuda externa».

Qué sigue

Lo que falta ahora es verificación externa. Ningún laboratorio independiente de benchmarks había publicado, al cierre de este artículo, una evaluación de Kolibri que contraste la cifra que reporta Aleph Alpha. Con los pesos ya en Hugging Face bajo Apache 2.0, la comunidad puede correr sus propias pruebas, afinar el modelo con datos propios y, sobre todo, poner a prueba la promesa central: que un modelo entrenado y servido bajo ley europea puede competir con la frontera sin ceder control.

El otro frente a vigilar es la adopción institucional. Firmar el Código de Buenas Prácticas de la UE es un gesto, no un contrato de compra; el dato que importará en los próximos meses es cuántos ministerios o proveedores industriales europeos reemplazan modelos extranjeros por Kolibri en producción, y bajo qué condiciones de infraestructura.

El router de Kolibri envía cada token a solo 6 de sus 384 expertos. Foto de Numan Ali en Unsplash

Probalo vos: los pesos y la ficha técnica de Kolibri ya están publicados en Hugging Face bajo licencia Apache 2.0, así que podés revisar el informe de 189 páginas antes de decidir si lo corrés en tu propia infraestructura.

📖 Resumen en Telegram: Ver resumen

📬 Recibí lo nuevo en tu email

Te avisamos de artículos grandes (1-2 por mes).

Preguntas frecuentes

¿Qué significa que Aleph Alpha Kolibri sea un modelo soberano?

Significa que se entrenó en infraestructura alemana y finlandesa bajo ley europea, y que un cliente puede desplegarlo en sus propios servidores sin que un proveedor externo controle o pueda desactivar el modelo.

¿Cuántos parámetros activa Kolibri por cada token?

Activa 3.460 millones de los 78.100 millones totales, un 4,4%, gracias a que su router envía cada token a solo 6 de 384 expertos más un experto compartido.

¿Qué licencia tiene el LLM soberano alemán?

Los pesos y los archivos de configuración se publicaron bajo licencia Apache 2.0. Aleph Alpha mantiene en privado el código y los métodos de entrenamiento.

¿El sistema de mezcla de expertos de Kolibri necesita menos memoria que un modelo denso equivalente?

No: aunque computa como un modelo de 3.460 millones de parámetros, necesita mantener en memoria los 78.100 millones completos, alrededor de 78 GB en FP8, porque el router puede enviar cualquier token a cualquier experto.

¿Por qué el tokenizador de Kolibri es relevante para hablantes de alemán?

Porque el alemán forma palabras compuestas largas, y el tokenizador UniBPE de Kolibri necesita 11,2% menos tokens que el de GPT-5 para representar el mismo texto en alemán, lo que abarata el procesamiento de ese idioma.

Referencias

  • tej.as: análisis técnico detallado de la arquitectura, el tokenizador y el informe de Kolibri.
  • Hugging Face: repositorio donde Aleph Alpha publicó los pesos de Kolibri bajo Apache 2.0.
  • Comisión Europea, Estrategia Digital: marco oficial del Reglamento de IA y el Código de Buenas Prácticas de IA de Propósito General.
  • Wikipedia: explicación general de la arquitectura de mezcla de expertos (MoE).
  • Aleph Alpha: sitio oficial de la compañía alemana que desarrolló Kolibri.

📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.

Imagen destacada: Foto de Kevin Ache en Unsplash

¿Te sirvió? ¿Te dio otro error? Contalo abajo: las preguntas se responden y le sirven al siguiente que llegue.

Dejar un comentario

Andrés Morales

Desarrollador e investigador en inteligencia artificial. Escribe sobre modelos de lenguaje, frameworks, herramientas para devs y lanzamientos open source. Cubre papers de ML, ecosistema de startups tech y tendencias de programación.

0 Comentarios

Deja un comentario

Marcador de posición del avatar

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Podés incluir código entre <code>…</code> o, para varias líneas, <pre><code>…</code></pre>.

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.