⏱️ Lectura: 10 min

Un estudio de investigadores de Princeton acaba de trazar una línea nítida en lo que los agentes de IA pueden y no pueden hacer todavía: resuelven con soltura tareas de ingeniería de investigación en machine learning, pero se quedan cortos cuando el problema exige ciencia abierta, es decir, formular una pregunta nueva y perseguirla sin un objetivo predefinido.

📑 En este artículo
  1. TL;DR
  2. Qué pasó
  3. Contexto e historia
  4. Detalles técnicos y rendimiento
  5. Cómo probarlo vos mismo
  6. Impacto y análisis
  7. Qué sigue
  8. Preguntas frecuentes
    1. ¿Qué significa “ingeniería de investigación” en este contexto?
    2. ¿Por qué los agentes fallan en ciencia abierta si ya resuelven benchmarks de código complejos?
    3. ¿Esto significa que la IA no sirve para hacer ciencia?
    4. ¿Qué otros estudios muestran hallazgos similares?
    5. ¿Cómo puedo evaluar si mi propio agente tiene esta limitación?
    6. ¿Cuándo se espera que los agentes cierren esta brecha?
  9. Referencias

La distinción importa porque buena parte del optimismo sobre “IA que hace ciencia” se apoya en evaluaciones donde el agente ya sabe qué botón tiene que apretar. Cuando ese botón desaparece, el comportamiento cambia por completo.

TL;DR

  • Investigadores de Princeton evaluaron agentes de IA en tareas de ingeniería de investigación en ML frente a tareas de ciencia abierta.
  • Los agentes rinden bien en tareas acotadas: depurar código, optimizar un pipeline, reproducir un experimento con instrucciones claras.
  • El desempeño cae cuando la tarea exige generar una hipótesis propia sin objetivo ni métrica de éxito predefinidos.
  • El hallazgo cuestiona que los agentes actuales puedan actuar hoy como investigadores científicos autónomos.
  • Se suma a una ola de evaluaciones 2025-2026 sobre autonomía de agentes en tareas de software e investigación.
  • La brecha entre ejecutar bien y descubrir algo nuevo se perfila como el próximo obstáculo de la IA agéntica.
  • El contexto llega mientras EE.UU. destina más de 5.000 millones de dólares a IA para ciencia vía la Genesis Mission.

Qué pasó

El reporte sobre el estudio de Princeton describe una evaluación con dos categorías de tareas asignadas a agentes de IA: por un lado, ingeniería de investigación en machine learning (depurar un script roto, ajustar hiperparámetros para alcanzar una métrica, reproducir un resultado publicado); por otro, ciencia abierta, donde el agente debe decidir qué pregunta vale la pena investigar y cómo probarla, sin una respuesta correcta ya conocida por el evaluador.

El resultado no es simétrico. En la primera categoría, los agentes se comportan de forma consistente y cercana a la de un ingeniero humano con experiencia intermedia. En la segunda, el rendimiento se degrada: los agentes tienden a repetir enfoques poco productivos, converger en soluciones triviales o simplemente no saber cuándo parar de explorar.

Contexto e historia

La brecha no aparece de la nada. Desde 2023, benchmarks como SWE-bench (para resolver issues reales de repositorios de software) y GAIA (para tareas generales de razonamiento y uso de herramientas) mostraron que los agentes mejoran rápido cuando la tarea tiene un criterio de éxito verificable. La organización METR viene documentando además cómo crece, evaluación tras evaluación, el “horizonte de tarea” que un agente puede sostener de forma autónoma antes de perder el hilo.

Del otro lado está el intento más ambicioso hasta ahora de automatizar la ciencia de punta a punta: proyectos como The AI Scientist de Sakana AI, que en 2024 propuso un pipeline donde un agente genera la idea, corre el experimento, escribe el paper y hasta lo revisa. La promesa era atractiva, pero expuso el mismo problema que ahora confirma Princeton: sin un juez externo que diga qué es “bueno”, el agente no tiene brújula.

agentes de ia trabajando sobre codigo y datos cientificos
La brecha aparece justo donde desaparece la métrica objetiva. Foto de Suzi Kim en Unsplash

El interés no es solo académico. La Casa Blanca anunció en julio de 2026 más de 5.000 millones de dólares para la Genesis Mission, su iniciativa de IA aplicada a investigación científica, y medios como STAT ya cuestionaron el equilibrio entre IA y otras áreas de la ciencia dentro de ese plan. Saber en qué es realmente buena hoy la IA agéntica, y en qué no, condiciona directamente hacia dónde conviene dirigir ese dinero.

Detalles técnicos y rendimiento

La clave técnica del hallazgo está en la estructura de la recompensa. Una tarea de ingeniería de investigación tiene, casi siempre, una función objetivo explícita: reducir una pérdida, superar un umbral de precisión, hacer pasar un test. El agente puede iterar, medir el resultado contra ese número y ajustar su siguiente intento. Es exactamente el tipo de bucle para el que se entrenan los modelos de lenguaje agénticos actuales.

Una tarea de ciencia abierta no ofrece esa señal. El agente tiene que decidir primero qué preguntar, después diseñar cómo comprobarlo y, encima, juzgar si el resultado que obtuvo es interesante. Ese triple salto (definir el objetivo, diseñar el experimento, evaluar el hallazgo) es justamente lo que distingue a un investigador de un ejecutor muy competente.

Tipo de tareaEjemplo típicoQué exige del agenteDesempeño observado
Ingeniería de investigaciónOptimizar un pipeline de entrenamiento, depurar un script, reproducir un baseline publicadoSeguir instrucciones e iterar contra una métrica ya definidaAlto, cercano al de un ingeniero junior a semi-senior
Ciencia abiertaProponer una hipótesis original, diseñar el experimento que la ponga a prueba, decidir qué medirDefinir el propio objetivo y tolerar ambigüedad sin señal de éxito claraBajo, se dispersa o converge en soluciones triviales

💭 Clave: no es que el agente “no sepa ciencia”, es que no sabe cuándo detenerse ni qué contar como un resultado válido si nadie se lo dice antes.

Cómo probarlo vos mismo

No hace falta acceso al estudio original para reproducir la idea a pequeña escala. Alcanza con armar dos lotes de tareas para tu propio agente (uno acotado, uno abierto) y comparar la varianza de los resultados entre ambos.

from dataclasses import dataclass

@dataclass
class Tarea:
    descripcion: str
    tipo: str  # "ingenieria" o "ciencia_abierta"
    criterio_exito: str | None  # None si es una tarea abierta

tareas = [
    Tarea("Reducir el tiempo de entrenamiento del modelo baseline en un 20%",
          "ingenieria", "tiempo_epoca <= objetivo"),
    Tarea("Proponer una hipótesis nueva sobre por qué el modelo generaliza peor en el dominio B",
          "ciencia_abierta", None),
]

for tarea in tareas:
    print(f"[{tarea.tipo}] {tarea.descripcion}")

Ese esqueleto solo declara el lote. Lo que revela el patrón de Princeton es el evaluador: en las tareas acotadas alcanza con comparar un número contra un umbral; en las abiertas hace falta un criterio cualitativo.

def evaluar_tarea_ingenieria(resultado, objetivo):
    """Compara el resultado contra una metrica numerica conocida."""
    return resultado.metrica >= objetivo.metrica_minima

def evaluar_tarea_abierta(resultado, revisor_humano):
    """Sin metrica de referencia: un revisor humano puntua originalidad,
    validez metodologica y si la hipotesis es contrastable."""
    return revisor_humano.calificar(
        originalidad=resultado.hipotesis,
        metodologia=resultado.diseno_experimental,
        contrastabilidad=resultado.es_falsable,
    )

resultados = agente.ejecutar_lote(tareas)
for tarea, resultado in zip(tareas, resultados):
    aprobado = (
        evaluar_tarea_ingenieria(resultado, tarea)
        if tarea.tipo == "ingenieria"
        else evaluar_tarea_abierta(resultado, revisor_humano="editor_senior")
    )
    print(tarea.descripcion, "->", "aprobado" if aprobado else "insuficiente")

Para confirmar si tu propio agente cae en el mismo patrón, corré el mismo lote varias veces y compará la varianza de resultados entre las tareas acotadas y las abiertas. Si la varianza en las abiertas es mucho mayor, acabás de replicar el hallazgo a escala de bolsillo.

comparacion visual entre tarea acotada y tarea de investigacion abierta
La métrica clara es lo que separa un ejecutor de un investigador. Foto de Pawel Czerwinski en Unsplash

Impacto y análisis

El hallazgo no dice que la IA sea inútil para la ciencia: dice dónde encaja hoy. Un agente que optimiza pipelines, limpia datasets o reproduce un experimento publicado ya ahorra tiempo real de investigador. Lo que todavía no hace de forma confiable es decidir qué investigar y por qué eso importa.

Ese matiz choca con el discurso de inversión reciente. La Genesis Mission estadounidense y anuncios similares en distintos países presentan a la IA como acelerador general de la ciencia, sin distinguir siempre entre automatizar el trabajo de banco y automatizar el descubrimiento. El estudio de Princeton funciona como un chequeo de realidad útil para quien tenga que decidir en qué parte del proceso científico conviene meter agentes hoy.

⚠️ Ojo: un agente que rinde bien en benchmarks de código no garantiza que rinda igual de bien eligiendo qué problema atacar. Son dos habilidades distintas y se evalúan distinto.

Qué sigue

Es esperable que la próxima generación de evaluaciones deje de mezclar ambos tipos de tarea en un solo puntaje y empiece a reportarlos por separado, tal como ya venían pidiendo evaluaciones tipo METR. También es probable que los laboratorios que promocionan agentes “científicos” empiecen a mostrar por separado qué porción de su pipeline es ingeniería reproducible y qué porción es exploración genuina, para no vender lo primero como si fuera lo segundo.

📖 Resumen en Telegram: Ver resumen

Probalo vos: armá dos tareas para tu agente favorito, una con métrica clara y otra sin ella, y compará cuánto tarda en “rendirse” en cada una.

Preguntas frecuentes

¿Qué significa “ingeniería de investigación” en este contexto?

Tareas de machine learning con un objetivo medible: optimizar código, ajustar hiperparámetros, reproducir un experimento ya publicado. Hay una métrica contra la cual comparar el resultado.

¿Por qué los agentes fallan en ciencia abierta si ya resuelven benchmarks de código complejos?

Porque resolver código complejo sigue siendo ejecutar contra un criterio conocido (que el test pase). La ciencia abierta exige definir ese criterio antes de poder aplicarlo.

¿Esto significa que la IA no sirve para hacer ciencia?

No. Significa que hoy es más confiable como acelerador de las etapas mecánicas del proceso científico que como generador de las preguntas de investigación.

¿Qué otros estudios muestran hallazgos similares?

Evaluaciones de autonomía como las de METR y proyectos como The AI Scientist de Sakana AI documentaron patrones parecidos: buen desempeño en tareas con métrica, resultados más débiles en exploración sin guía.

¿Cómo puedo evaluar si mi propio agente tiene esta limitación?

Corré el mismo agente contra un lote de tareas acotadas y otro de tareas abiertas, y compará la varianza y la calidad de los resultados entre ambos lotes.

¿Cuándo se espera que los agentes cierren esta brecha?

No hay una fecha verificable todavía. Lo que sí es medible es el avance: seguir la evolución de benchmarks como SWE-bench, GAIA y las evaluaciones de METR da una señal concreta trimestre a trimestre.

Referencias

📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.

Imagen destacada: Foto de Numan Ali en Unsplash


Andrés Morales

Desarrollador e investigador en inteligencia artificial. Escribe sobre modelos de lenguaje, frameworks, herramientas para devs y lanzamientos open source. Cubre papers de ML, ecosistema de startups tech y tendencias de programación.

0 Comentarios

Deja un comentario

Marcador de posición del avatar

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.