2026-08-28 · ← Noticias
Anthropic muestra una IA que se auto-mejora y ajusta su propia alineación
AAR reemplaza el trabajo manual en el ajuste de alineación
El investigador de Anthropic Chen Yueh-Han introdujo el concepto del Automated Alignment Researcher (AAR). Es un sistema que replica el trabajo humano en el ajuste de modelos de lenguaje. AAR primero revisa la literatura, propone un método de entrenamiento para un comportamiento desalineado específico y entrena el modelo con él durante 30 minutos. Prueba iterativamente y mantiene solo los métodos que funcionan. En una prueba a través de 10 benchmarks, el sistema mejoró las puntuaciones en todas las categorías sin degradar el rendimiento general.
El fin de las anotaciones manuales para los equipos de investigación
Esta es una demostración práctica de cómo se ve un flujo de trabajo agéntico en la investigación de IA. En lugar de que un equipo recopile manualmente ejemplos positivos y negativos para RLHF, el diseño del procedimiento de entrenamiento se delega al agente. El documento señala que el mejor método AAR supera lo que proponen humanos experimentados en promedio en seis horas. Esto significa iteraciones más rápidas al implementar modelos para tareas empresariales específicas que anteriormente requerían semanas de fine-tuning manual.
Las métricas de éxito automatizadas siguen siendo frágiles
El documento mide el éxito en un conjunto cerrado de 10 benchmarks. El problema central con el entrenamiento completamente automatizado es la ley de Goodhart: cuando un modelo evalúa su propio éxito contra una métrica proxy, eventualmente aprenderá a optimizar la métrica directamente a expensas de la seguridad real. Además, el informe guarda silencio sobre los costos. Seis horas de entrenamiento iterativo de modelos grandes para descubrir un método óptimo podrían quemar más presupuesto informático que el salario de un investigador si la arquitectura base es costosa.
Auditoría de los métodos propuestos
La prueba del éxito no será solo que AAR encuentre un método que funcione. El factor decisivo es si estos métodos descubiertos automáticamente siguen siendo interpretables para los humanos. Si un agente produce una actualización de pesos que corrige el comportamiento del benchmark pero deja al equipo adivinando por qué, introduce un riesgo inaceptable de caja negra para las implementaciones de producción.
El veredicto de Lilith
Estamos entregando a los modelos las llaves de su propio mantenimiento, sin saber si el comportamiento corregido solo significa una forma más inteligente de ocultar errores en un benchmark específico.
Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.
Fuente original ↗ ↗