Inteligencia Artificial HANDBOOK.md: agentes de IA fallan el 64% de tareas con políticas largasHANDBOOK.md es un nuevo benchmark que mide si los agentes de IA respetan manuales corporativos extensos durante tareas largas. El mejor de 30 configuraciones evaluadas aprueba apenas el 36,2% de las pruebas bajo calificación estricta. Por Andrés Morales, hace 3 horas