El Solitario

  • GNU/Linux
  • Tutoriales
  • Opinión

cumplimiento

Agente de IA revisando un extenso manual corporativo en una pantalla
Inteligencia Artificial

HANDBOOK.md: agentes de IA fallan el 64% de tareas con políticas largas

HANDBOOK.md es un nuevo benchmark que mide si los agentes de IA respetan manuales corporativos extensos durante tareas largas. El mejor de 30 configuraciones evaluadas aprueba apenas el 36,2% de las pruebas bajo calificación estricta.

Por Andrés Morales, hace 2 semanas
Cursos sobre Linux
Introducción a Linux: Instala Linux en tu PC

Introducción a Linux: Instala Linux en tu PC

Empieza seguro en Linux

4.2 | Gratis


Aprendiendo Linux: uso, terminal y comandos

Aprendiendo Linux: uso, terminal y comandos

Aprende sobre el entorno de escritorio y los comandos básicos de GNU/Linux

4.7 | $19.99

El Solitario > cumplimiento
Entradas recientes
  • Oxide lanza integraciones oficiales de Kubernetes: Rancher, Omni y Cluster API
  • Tailscale descubre un bug de 16 años en el WAL de SQLite
  • Grok 4.6: xAI iguala a GPT-5.6 Sol Max en el índice de Artificial Analysis
  • NVIDIA lanza Nemotron 3.5 Lightning, un MoE de 30B para agentes IA
  • Ngrok: compresores y LLM resuelven el mismo problema matemático
Categorías
  • GNU/Linux
  • Inteligencia Artificial
  • Microservicios
  • Noticias Tech
  • Opinión
  • Programación
  • Redes
  • Seguridad
  • Tutoriales
Comentarios recientes
  • Casey en El estándar OpenAI-compatible API: auditoría técnica del contrato de-facto que unificó la inferencia LLM (2020–2026)
  • Angel_Bran en Solucionar el problema con VSYNC en Linux
  • Angel_Bran en Configurar GRUB en Ubuntu y derivados: Cambiar el orden de arranque por defecto
  • Sergio en Configurar GRUB en Ubuntu y derivados: Cambiar el orden de arranque por defecto
  • carlitos en Solucionar el problema con VSYNC en Linux
Etiquetas
agentes algoritmos anthropic atencion autoaprendizaje benchmark benchmarks china chips codex cogs epub firmware fork github gpu hardware inferencia jailbreak Javascript kimi koreader lean llm microsoft moe moonshot opensource openweight optimizacion productividad Programacion Python qwen razonamiento regulacion robots rust seguridad sqlite tailscale vibecoding vpn vulnerabilidad wal
  • Política de privacidad
Hestia | Desarrollado por ThemeIsle