⏱️ Lectura: 10 min
Un estudio de investigadores de Princeton acaba de trazar una línea nítida en lo que los agentes de IA pueden y no pueden hacer todavía: resuelven con soltura tareas de ingeniería de investigación en machine learning, pero se quedan cortos cuando el problema exige ciencia abierta, es decir, formular una pregunta nueva y perseguirla sin un objetivo predefinido.
📑 En este artículo
- TL;DR
- Qué pasó
- Contexto e historia
- Detalles técnicos y rendimiento
- Cómo probarlo vos mismo
- Impacto y análisis
- Qué sigue
- Preguntas frecuentes
- ¿Qué significa “ingeniería de investigación” en este contexto?
- ¿Por qué los agentes fallan en ciencia abierta si ya resuelven benchmarks de código complejos?
- ¿Esto significa que la IA no sirve para hacer ciencia?
- ¿Qué otros estudios muestran hallazgos similares?
- ¿Cómo puedo evaluar si mi propio agente tiene esta limitación?
- ¿Cuándo se espera que los agentes cierren esta brecha?
- Referencias
La distinción importa porque buena parte del optimismo sobre “IA que hace ciencia” se apoya en evaluaciones donde el agente ya sabe qué botón tiene que apretar. Cuando ese botón desaparece, el comportamiento cambia por completo.
TL;DR
- Investigadores de Princeton evaluaron agentes de IA en tareas de ingeniería de investigación en ML frente a tareas de ciencia abierta.
- Los agentes rinden bien en tareas acotadas: depurar código, optimizar un pipeline, reproducir un experimento con instrucciones claras.
- El desempeño cae cuando la tarea exige generar una hipótesis propia sin objetivo ni métrica de éxito predefinidos.
- El hallazgo cuestiona que los agentes actuales puedan actuar hoy como investigadores científicos autónomos.
- Se suma a una ola de evaluaciones 2025-2026 sobre autonomía de agentes en tareas de software e investigación.
- La brecha entre ejecutar bien y descubrir algo nuevo se perfila como el próximo obstáculo de la IA agéntica.
- El contexto llega mientras EE.UU. destina más de 5.000 millones de dólares a IA para ciencia vía la Genesis Mission.
Qué pasó
El reporte sobre el estudio de Princeton describe una evaluación con dos categorías de tareas asignadas a agentes de IA: por un lado, ingeniería de investigación en machine learning (depurar un script roto, ajustar hiperparámetros para alcanzar una métrica, reproducir un resultado publicado); por otro, ciencia abierta, donde el agente debe decidir qué pregunta vale la pena investigar y cómo probarla, sin una respuesta correcta ya conocida por el evaluador.
El resultado no es simétrico. En la primera categoría, los agentes se comportan de forma consistente y cercana a la de un ingeniero humano con experiencia intermedia. En la segunda, el rendimiento se degrada: los agentes tienden a repetir enfoques poco productivos, converger en soluciones triviales o simplemente no saber cuándo parar de explorar.
Contexto e historia
La brecha no aparece de la nada. Desde 2023, benchmarks como SWE-bench (para resolver issues reales de repositorios de software) y GAIA (para tareas generales de razonamiento y uso de herramientas) mostraron que los agentes mejoran rápido cuando la tarea tiene un criterio de éxito verificable. La organización METR viene documentando además cómo crece, evaluación tras evaluación, el “horizonte de tarea” que un agente puede sostener de forma autónoma antes de perder el hilo.
Del otro lado está el intento más ambicioso hasta ahora de automatizar la ciencia de punta a punta: proyectos como The AI Scientist de Sakana AI, que en 2024 propuso un pipeline donde un agente genera la idea, corre el experimento, escribe el paper y hasta lo revisa. La promesa era atractiva, pero expuso el mismo problema que ahora confirma Princeton: sin un juez externo que diga qué es “bueno”, el agente no tiene brújula.
El interés no es solo académico. La Casa Blanca anunció en julio de 2026 más de 5.000 millones de dólares para la Genesis Mission, su iniciativa de IA aplicada a investigación científica, y medios como STAT ya cuestionaron el equilibrio entre IA y otras áreas de la ciencia dentro de ese plan. Saber en qué es realmente buena hoy la IA agéntica, y en qué no, condiciona directamente hacia dónde conviene dirigir ese dinero.
Detalles técnicos y rendimiento
La clave técnica del hallazgo está en la estructura de la recompensa. Una tarea de ingeniería de investigación tiene, casi siempre, una función objetivo explícita: reducir una pérdida, superar un umbral de precisión, hacer pasar un test. El agente puede iterar, medir el resultado contra ese número y ajustar su siguiente intento. Es exactamente el tipo de bucle para el que se entrenan los modelos de lenguaje agénticos actuales.
Una tarea de ciencia abierta no ofrece esa señal. El agente tiene que decidir primero qué preguntar, después diseñar cómo comprobarlo y, encima, juzgar si el resultado que obtuvo es interesante. Ese triple salto (definir el objetivo, diseñar el experimento, evaluar el hallazgo) es justamente lo que distingue a un investigador de un ejecutor muy competente.
| Tipo de tarea | Ejemplo típico | Qué exige del agente | Desempeño observado |
|---|---|---|---|
| Ingeniería de investigación | Optimizar un pipeline de entrenamiento, depurar un script, reproducir un baseline publicado | Seguir instrucciones e iterar contra una métrica ya definida | Alto, cercano al de un ingeniero junior a semi-senior |
| Ciencia abierta | Proponer una hipótesis original, diseñar el experimento que la ponga a prueba, decidir qué medir | Definir el propio objetivo y tolerar ambigüedad sin señal de éxito clara | Bajo, se dispersa o converge en soluciones triviales |
💭 Clave: no es que el agente “no sepa ciencia”, es que no sabe cuándo detenerse ni qué contar como un resultado válido si nadie se lo dice antes.
Cómo probarlo vos mismo
No hace falta acceso al estudio original para reproducir la idea a pequeña escala. Alcanza con armar dos lotes de tareas para tu propio agente (uno acotado, uno abierto) y comparar la varianza de los resultados entre ambos.
from dataclasses import dataclass
@dataclass
class Tarea:
descripcion: str
tipo: str # "ingenieria" o "ciencia_abierta"
criterio_exito: str | None # None si es una tarea abierta
tareas = [
Tarea("Reducir el tiempo de entrenamiento del modelo baseline en un 20%",
"ingenieria", "tiempo_epoca <= objetivo"),
Tarea("Proponer una hipótesis nueva sobre por qué el modelo generaliza peor en el dominio B",
"ciencia_abierta", None),
]
for tarea in tareas:
print(f"[{tarea.tipo}] {tarea.descripcion}")
Ese esqueleto solo declara el lote. Lo que revela el patrón de Princeton es el evaluador: en las tareas acotadas alcanza con comparar un número contra un umbral; en las abiertas hace falta un criterio cualitativo.
def evaluar_tarea_ingenieria(resultado, objetivo):
"""Compara el resultado contra una metrica numerica conocida."""
return resultado.metrica >= objetivo.metrica_minima
def evaluar_tarea_abierta(resultado, revisor_humano):
"""Sin metrica de referencia: un revisor humano puntua originalidad,
validez metodologica y si la hipotesis es contrastable."""
return revisor_humano.calificar(
originalidad=resultado.hipotesis,
metodologia=resultado.diseno_experimental,
contrastabilidad=resultado.es_falsable,
)
resultados = agente.ejecutar_lote(tareas)
for tarea, resultado in zip(tareas, resultados):
aprobado = (
evaluar_tarea_ingenieria(resultado, tarea)
if tarea.tipo == "ingenieria"
else evaluar_tarea_abierta(resultado, revisor_humano="editor_senior")
)
print(tarea.descripcion, "->", "aprobado" if aprobado else "insuficiente")
Para confirmar si tu propio agente cae en el mismo patrón, corré el mismo lote varias veces y compará la varianza de resultados entre las tareas acotadas y las abiertas. Si la varianza en las abiertas es mucho mayor, acabás de replicar el hallazgo a escala de bolsillo.
Impacto y análisis
El hallazgo no dice que la IA sea inútil para la ciencia: dice dónde encaja hoy. Un agente que optimiza pipelines, limpia datasets o reproduce un experimento publicado ya ahorra tiempo real de investigador. Lo que todavía no hace de forma confiable es decidir qué investigar y por qué eso importa.
Ese matiz choca con el discurso de inversión reciente. La Genesis Mission estadounidense y anuncios similares en distintos países presentan a la IA como acelerador general de la ciencia, sin distinguir siempre entre automatizar el trabajo de banco y automatizar el descubrimiento. El estudio de Princeton funciona como un chequeo de realidad útil para quien tenga que decidir en qué parte del proceso científico conviene meter agentes hoy.
⚠️ Ojo: un agente que rinde bien en benchmarks de código no garantiza que rinda igual de bien eligiendo qué problema atacar. Son dos habilidades distintas y se evalúan distinto.
Qué sigue
Es esperable que la próxima generación de evaluaciones deje de mezclar ambos tipos de tarea en un solo puntaje y empiece a reportarlos por separado, tal como ya venían pidiendo evaluaciones tipo METR. También es probable que los laboratorios que promocionan agentes “científicos” empiecen a mostrar por separado qué porción de su pipeline es ingeniería reproducible y qué porción es exploración genuina, para no vender lo primero como si fuera lo segundo.
📖 Resumen en Telegram: Ver resumen
Probalo vos: armá dos tareas para tu agente favorito, una con métrica clara y otra sin ella, y compará cuánto tarda en “rendirse” en cada una.
Preguntas frecuentes
¿Qué significa “ingeniería de investigación” en este contexto?
Tareas de machine learning con un objetivo medible: optimizar código, ajustar hiperparámetros, reproducir un experimento ya publicado. Hay una métrica contra la cual comparar el resultado.
¿Por qué los agentes fallan en ciencia abierta si ya resuelven benchmarks de código complejos?
Porque resolver código complejo sigue siendo ejecutar contra un criterio conocido (que el test pase). La ciencia abierta exige definir ese criterio antes de poder aplicarlo.
¿Esto significa que la IA no sirve para hacer ciencia?
No. Significa que hoy es más confiable como acelerador de las etapas mecánicas del proceso científico que como generador de las preguntas de investigación.
¿Qué otros estudios muestran hallazgos similares?
Evaluaciones de autonomía como las de METR y proyectos como The AI Scientist de Sakana AI documentaron patrones parecidos: buen desempeño en tareas con métrica, resultados más débiles en exploración sin guía.
¿Cómo puedo evaluar si mi propio agente tiene esta limitación?
Corré el mismo agente contra un lote de tareas acotadas y otro de tareas abiertas, y compará la varianza y la calidad de los resultados entre ambos lotes.
¿Cuándo se espera que los agentes cierren esta brecha?
No hay una fecha verificable todavía. Lo que sí es medible es el avance: seguir la evolución de benchmarks como SWE-bench, GAIA y las evaluaciones de METR da una señal concreta trimestre a trimestre.
Referencias
- Cobertura del estudio de Princeton en MSN: resume el hallazgo sobre agentes de IA en ingeniería de investigación frente a ciencia abierta.
- Anuncio oficial de la Genesis Mission: más de 5.000 millones de dólares del gobierno de EE.UU. para IA aplicada a la ciencia.
- STAT sobre el blueprint científico de la Casa Blanca: contexto sobre el peso de la IA frente a otras áreas científicas en la política federal.
- Princeton University: sitio oficial de la institución que llevó adelante la evaluación.
📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.
0 Comentarios