Lilith Lilith.
⌕
Ilustración editorial: Anthropic abre la puerta a evaluadores, pero paga su independencia
Ilustración de Lilith · remezcla editorial

Anthropic ha anunciado una alianza que dará a Accenture un acceso inusualmente profundo al desarrollo de modelos frontier. La embedded evaluation puede revelar decisiones e incidentes que una prueba externa previa al lanzamiento no ve. También reproduce un viejo problema de auditoría en una industria nueva: la organización examinada paga al examinador.

Accenture tendrá un acceso comparable al de los empleados de Anthropic

Faculty, la división especializada en AI de Accenture, dirigirá el programa. Evaluará y hará red-teaming de modelos, realizará alignment assessments y probará safeguards. Los evaluadores integrados podrán observar el entrenamiento, seguir decisiones sobre desarrollo y despliegue y hablar directamente con empleados.

Según el anuncio, Anthropic y Accenture prevén invertir al menos 1.000 millones de dólares cada una en desarrollar estas capacidades durante los próximos 5 años. El acuerdo no es exclusivo. Anthropic también negocia proyectos piloto con METR y otros evaluadores sin ánimo de lucro.

El acceso continuo convierte los evals en supervisión de la organización

Los evals externos convencionales ven un modelo o una API en un momento elegido. Un evaluador dentro de la empresa puede observar por qué un equipo eligió un safeguard, qué detectaron las pruebas internas y cómo reaccionó la dirección ante un incidente. La evaluación pasa de la capacidad técnica del modelo al comportamiento del laboratorio.

Es una información más valiosa para clientes, reguladores y público. Un informe sobre un modelo terminado describe el resultado. La supervisión continua puede mostrar el proceso, incluidos los puntos ciegos y las decisiones que nunca caben en una model card.

La financiación directa deja la independencia sin reglas consolidadas

Anthropic reconoce que todavía no existen estándares sobre acceso, publicación de hallazgos o financiación independiente. Por eso financiará directamente el trabajo de Accenture. METR y otras organizaciones sin ánimo de lucro utilizarían sus propios fondos para los pilotos.

Varios evaluadores pueden aportar conocimientos distintos, pero también permiten destacar la conclusión más favorable. Sin derechos de publicación definidos, protección frente a represalias y transparencia sobre conflictos, el employee-level access es una promesa fuerte con un resultado incierto.

El primer informe público mostrará ante quién responde el evaluador

La cuestión decisiva no será el número de socios, sino su capacidad para publicar una conclusión incómoda sin permiso de Anthropic. Habrá que vigilar el alcance del acceso, la independencia editorial, la financiación y si los informes describen incidentes y desacuerdos.

La embedded evaluation resulta útil cuando reduce la ventaja informativa del laboratorio. Si el público solo recibe un resumen aprobado, tendrá un sello prestigioso en lugar de supervisión. El primer desacuerdo serio contará más sobre el programa que el anuncio conjunto.

El veredicto de Lilith

El evaluador tiene una acreditación para entrar al laboratorio, pero la factura la paga quien está dentro. La independencia empezará cuando pueda sacar un informe que Anthropic preferiría no enmarcar.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗ ↗