⏱️ Lectura: 11 min

Databricks corrió el mismo modelo, con el mismo nivel de razonamiento, a través de tres harnesses de código distintos sobre su base de millones de líneas: el que ganó en calidad y costó menos fue el más simple de los tres, el harness minimalista Pi.

📑 En este artículo
  1. TL;DR
  2. Qué pasó: nace el harness minimalista Pi
  3. Contexto e historia
  4. Detalles técnicos y rendimiento
  5. Cómo probarlo
  6. Impacto y análisis
  7. Qué sigue
  8. Preguntas frecuentes
    1. ¿Qué es exactamente el harness minimalista Pi?
    2. ¿Por qué Databricks dice que el harness importa tanto como el modelo?
    3. ¿Qué es pi-autoresearch?
    4. ¿Con qué modelo probó Databricks el harness Pi?
    5. ¿Qué significa que Pi sea autoextensible?
    6. ¿Cuál es la principal desventaja de un harness minimalista como Pi?
  9. Referencias

El resultado contrasta con la tendencia dominante en la industria: mientras varias compañías suman más capas, más orquestación y prompts cada vez más largos a sus asistentes de código, Pi apuesta por lo contrario. Ese contraste es el centro de un análisis reciente de Earendil sobre el benchmark de Databricks y una extensión que construyó Shopify.

TL;DR

  • Databricks probó Pi, Claude Code y Codex sobre su codebase de millones de líneas con el mismo modelo y nivel de razonamiento.
  • Pi combinado con Claude Opus 4.8 en modo xhigh logró el pass-rate más alto y el costo más bajo de los tres harnesses.
  • El system prompt y las tool definitions de Pi ocupan menos de 1.000 tokens; el harness trae solo 4 herramientas de fábrica.
  • Databricks midió hasta el doble de costo por tarea entre harnesses corriendo el mismo modelo, con calidad equivalente.
  • Pi envió cerca de 3 veces menos contexto por turno que los harnesses comparados, según el reporte citado por Earendil.
  • Shopify construyó pi-autoresearch pidiéndole en lenguaje natural a Pi que creara la extensión desde su propia documentación.
  • Shopify reportó unit tests corriendo 300 veces más rápido y el montaje de componentes React un 20% más veloz.
  • Anthropic recortó el system prompt de Claude Code en un 80%, señal de que los modelos ya necesitan menos instrucciones nativas.

Qué pasó: nace el harness minimalista Pi

Pi es un harness de programación con IA (la capa de software que conecta un modelo de lenguaje con el editor, la terminal y el resto del entorno) que llega de fábrica con apenas 4 herramientas. Su system prompt y las definiciones de esas herramientas ocupan menos de 1.000 tokens en total, según el análisis de Earendil. La apuesta es que la mayoría del trabajo se resuelve con lo básico, y si un equipo necesita algo más específico, lo construye encima.

Ese enfoque quedó bajo la lupa cuando Databricks publicó un estudio propio, “Benchmarking Coding Agents on Databricks’ Multi-Million Line Codebase”. El objetivo era averiguar qué agentes de código rinden mejor en tareas reales y cómo varía ese rendimiento según el precio. Para evitar el sesgo de los benchmarks públicos, que según Databricks ya están sobresaturados, el equipo armó su propio set de tareas basado en el trabajo diario de sus propios ingenieros.

Los resultados no dejaron dudas: “el harness desde el que se llama a un modelo impacta dramáticamente el costo y la calidad”, escribió Databricks, y agregó que “en muchos casos, harnesses simples como Pi rindieron mejor en nuestras cargas de trabajo”. Combinado con Claude Opus 4.8 en modo de razonamiento xhigh, Pi logró el pass-rate más alto de los tres harnesses evaluados, a un costo significativamente menor que Claude Code y Codex.

Contexto e historia

La lógica detrás de sumar capas tiene sentido a primera vista: la IA volvió barato escribir código, así que muchas empresas empezaron a construir herramientas cada vez más grandes buscando mejor rendimiento. Prompts más largos, más orquestación, más capas de abstracción. El problema es que esa complejidad también encarece cada corrida, porque cada capa agrega tokens que el modelo tiene que leer en cada turno.

Hace apenas un año había un argumento razonable a favor de los harnesses nativos (los construidos por el mismo laboratorio que entrena el modelo): la idea era que el modelo estaba entrenado alrededor de ese harness específico y por lo tanto rendía mejor ahí. Ese argumento se debilitó. Los modelos de frontera actuales entienden bien un entorno de terminal genérico y saben actuar dentro de él sin instrucciones nativas extensas.

Una señal de ese cambio: Anthropic recortó el system prompt de Claude Code en un 80%, según recoge el análisis de Earendil. El foco de la industria se está moviendo de “qué tan nativo es el harness” a “qué tan bien maneja el contexto para evitar redundancia”. Los modelos necesitan una interfaz clara al entorno, no un harness que desperdicie contexto repitiendo información.

Detalles técnicos y rendimiento

La diferencia de costo que midió Databricks no vino de usar un modelo distinto: corrieron el mismo modelo, con el mismo nivel de razonamiento, a través de los tres harnesses. Aun así, “el costo por tarea difirió significativamente, más del doble en algunos casos, mientras la calidad se mantuvo igual”, reportó el equipo. Databricks llama a esto la “disciplina de contexto” de Pi: “Pi envió cerca de 3 veces menos contexto por turno. Manejó mejor el contexto, manteniendo un working set más ajustado y terminando las tareas en menos corridas”.

Comparación visual entre un harness minimalista y uno con múltiples capas de herramientas
Menos capas fijas por turno, más presupuesto de tokens para el código real. Foto de National Institute of Allergy and Infectious Diseases en Unsplash
💭 Clave: Databricks resume la ventaja de Pi como “disciplina de contexto”: no se trata de tener menos funciones porque sí, sino de no pagar en tokens por funciones que la tarea actual no usa.

HarnessHerramientas de fábricaSystem promptResultado en el benchmark de Databricks
Pi4Menos de 1.000 tokensMayor pass-rate, menor costo por tarea
Claude CodeVarias, con orquestación adicionalMayor, aunque recortado 80% recientementePass-rate menor, costo más alto que Pi
CodexVarias, con orquestación adicionalMayorPass-rate menor, costo más alto que Pi

Ese dato importa porque el costo real de un agente no depende solo del precio por token del modelo: depende de cuántos tokens hay que mandar en cada turno y cuántos turnos hace falta para terminar la tarea. Según el análisis de Earendil, un modelo más fuerte y más caro, corrido con un harness eficiente, puede terminar costando menos que la combinación inversa. Es el mismo patrón que ya se observaba a nivel de modelo (correr flujos complejos en Haiku 4.5 salía más caro que en Sonnet 4.6 cuando había ejecución de código de por medio, porque el agente necesitaba más turnos para completar la tarea), pero ahora se repite también a nivel de harness.

Cómo probarlo

Pi no es solo minimalista: también es autoextensible. En vez de que el proveedor intente anticipar cada flujo de trabajo posible y empaquetarlo de fábrica, Pi lee su propia documentación de extensiones y arma un flujo nuevo cuando se lo pedís en lenguaje natural. Así construyó Shopify pi-autoresearch, según describe David Cortés en el blog de ingeniería de Shopify: le pidió directamente al agente que creara la extensión y el harness empezó a construirla desde su propia documentación.

Pi, crea una extension para Autoresearch: quiero un loop autonomo
que optimice un target medible (tiempo de build, velocidad de tests,
tiempo de render) probando cambios, midiendo el resultado y
descartando las regresiones automaticamente.

pi-autoresearch es un loop autónomo de optimización: cuando le pedís un cambio, corre experimentos para descubrir qué funciona y qué causa regresiones. Mientras el objetivo sea medible, el sistema puede seguir descartando regresiones y mejorando solo. Shopify reportó unit tests corriendo 300 veces más rápido, montaje de componentes React un 20% más veloz, tiempos de build reducidos en varios proyectos y hasta mejoras de rendimiento en pnpm.

Loop autónomo de optimización midiendo tests y regresiones de código
pi-autoresearch descarta regresiones mientras el objetivo siga siendo medible. Foto de National Institute of Allergy and Infectious Diseases en Unsplash

Antes de sumar una herramienta a tu propio harness, conviene medir cuánto contexto fijo agrega. Un método reproducible: contar los tokens del system prompt y de las tool definitions con un tokenizador.

import tiktoken

encoding = tiktoken.get_encoding("cl100k_base")
with open("system_prompt.txt") as f:
    prompt = f.read()

tokens = encoding.encode(prompt)
print(f"Tokens en el system prompt: {len(tokens)}")

Este mismo método (contar tokens del prompt base y del set de herramientas) es el que permite comparar la disciplina de contexto de dos harnesses antes de elegir uno para un equipo: cuanto menos contexto fijo carga cada turno, más presupuesto de tokens queda disponible para el código real del proyecto.

Impacto y análisis

El hallazgo de Databricks sobre el harness minimalista Pi separa dos variables que solían mezclarse: el modelo y el harness. Hasta ahora, buena parte de la conversación sobre agentes de código giraba en torno a qué modelo usar. El estudio muestra que la elección del harness puede pesar tanto como esa decisión, incluso corriendo exactamente el mismo modelo.

flowchart TD
A["Modelo: Opus 4.8 xhigh"] --> B["Harness minimalista Pi"]
B --> C["4 herramientas base"]
B --> D["Extension: pi-autoresearch"]
D --> E["Loop de optimizacion autonomo"]
C --> F["Tarea completada"]
E --> F
💡 Tip: antes de sumar una herramienta nueva a tu propio agente, preguntate si de verdad se gana el lugar: cada tool definition extra es contexto fijo que se manda en cada turno, incluso en las tareas donde no se usa.

También hay una lectura sobre extensibilidad. Pi no compite ofreciendo más funciones de fábrica, compite ofreciendo menos fricción para construir las propias. Eso traslada la responsabilidad de anticipar el flujo de trabajo del proveedor al equipo que lo usa, algo que le funcionó bien a Shopify y a Databricks, pero que puede ser una desventaja real para equipos chicos sin tiempo ni capacidad de ingeniería para construir sus propias extensiones.

Qué sigue

Earendil menciona además que los modelos locales avanzan rápido y los describe como muy prometedores. Si esa tendencia se sostiene, un harness liviano como Pi, que no depende de orquestación pesada, tiene una ventaja adicional: menos infraestructura fija que portar cuando el modelo corre en el propio hardware del equipo.

El otro movimiento a seguir es si más laboratorios repiten el recorte de prompt que hizo Anthropic con Claude Code. Si los modelos de frontera siguen mejorando su capacidad de operar en entornos de terminal genéricos sin instrucciones extensas, la ventaja de los harnesses nativos y pesados debería seguir reduciéndose, y estudios como el de Databricks, que aíslan el harness como variable, probablemente se vuelvan más comunes.

📖 Resumen en Telegram: Ver resumen

Probalo vos: medí cuántos tokens ocupa el system prompt y las tool definitions de tu propio harness de código con el snippet de tiktoken de arriba y compará ese número contra los menos de 1.000 tokens que reporta Pi.

Preguntas frecuentes

¿Qué es exactamente el harness minimalista Pi?

Es una capa de software para programar con IA que conecta un modelo de lenguaje con el entorno de desarrollo usando solo 4 herramientas de fábrica, con un system prompt de menos de 1.000 tokens, según describe Earendil.

¿Por qué Databricks dice que el harness importa tanto como el modelo?

Porque corrió el mismo modelo, con el mismo nivel de razonamiento, a través de distintos harnesses, y encontró diferencias de costo de más del doble entre ellos con calidad equivalente.

¿Qué es pi-autoresearch?

Es una extensión de Pi que construyó Shopify: un loop autónomo que prueba cambios, mide el resultado contra un objetivo medible y descarta las regresiones automáticamente.

¿Con qué modelo probó Databricks el harness Pi?

El estudio lo probó junto a Claude Opus 4.8 en modo de razonamiento xhigh, la combinación que obtuvo el mayor pass-rate al menor costo entre los harnesses evaluados.

¿Qué significa que Pi sea autoextensible?

Que el propio harness lee su documentación de extensiones y arma un flujo de trabajo nuevo cuando se lo pedís en lenguaje natural, sin que el proveedor tenga que anticipar cada caso de uso de fábrica.

¿Cuál es la principal desventaja de un harness minimalista como Pi?

Que traslada a cada equipo la responsabilidad de construir las herramientas que sí necesita, algo que le sirvió a Shopify y Databricks pero que exige capacidad de ingeniería propia.

Referencias

  • Earendil: Pi, Minimal and Performant: el análisis que compara el harness Pi contra Claude Code y Codex usando el estudio de Databricks.
  • Databricks: autora del estudio “Benchmarking Coding Agents on Databricks’ Multi-Million Line Codebase” citado en el análisis de Earendil.
  • Shopify Engineering: blog donde se describió la construcción de la extensión pi-autoresearch.
  • Claude Code (Anthropic) en GitHub: el harness cuyo recorte de system prompt en un 80% se menciona como contexto del cambio de tendencia.

📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.

Imagen destacada: Foto de Bernd 📷 Dittrich en Unsplash


Andrés Morales

Desarrollador e investigador en inteligencia artificial. Escribe sobre modelos de lenguaje, frameworks, herramientas para devs y lanzamientos open source. Cubre papers de ML, ecosistema de startups tech y tendencias de programación.

0 Comentarios

Deja un comentario

Marcador de posición del avatar

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.