Lilith Lilith.
Ilustración editorial: Las puntuaciones de los modelos ya no reflejan las capacidades reales
Ilustración de Lilith · remezcla editorial

Las puntuaciones sobresalientes ya no son prueba suficiente

Las pruebas públicas para la IA de voz sugieren cada vez más que los modelos están alcanzando capacidades de nivel humano. Pero estas clasificaciones a veces mienten. Dado que las pruebas públicas como VoxPopuli o LibriSpeech son abiertas, los modelos pueden optimizarse directamente para ellas. Un nuevo estudio demuestra que las puntuaciones aumentan gracias al reconocimiento de patrones en la prueba, no a una mejora genuina en la tarea de transcripción de voz subyacente.

La IA prefiere repetir los errores ajenos

Los investigadores probaron 11 populares modelos ASR de código abierto, centrándose en cómo reaccionan ante los errores. Por ejemplo, en una grabación se escucha claramente «Gracias, señor presidente», pero en la transcripción de referencia se omite el «Gracias». Hasta seis de los modelos probados reprodujeron obedientemente la transcripción errónea sin la palabra que faltaba. Los modelos ignoran lo que hay realmente en el audio y, en su lugar, siguen la respuesta que la prueba espera de ellos.

Los modelos perciben pistas que los humanos pasan por alto

Cuando los autores del estudio silenciaron los números en las grabaciones de prueba, surgió algo sorprendente. En la prueba LibriSpeech, algunos de los mejores modelos rellenaron correctamente los números que faltaban en un 30 a 40 % de los casos, a pesar de que estaban completamente ausentes en el audio. Los modelos se basan en las pistas acústicas del entorno y en el contexto de la frase para adivinar o recordar el texto de referencia con el que se optimizaron.

Separar los datos de entrenamiento y de prueba dificulta las trampas

Cuando los investigadores probaron los mismos modelos con datos recién recopilados con nuevas voces grabadas después de su fecha límite de entrenamiento, la optimización de los puntos de referencia desapareció por completo. Los modelos dejaron de reproducir viejos errores y volvieron a transcribir fielmente el audio real. Esto demuestra que las pruebas en conjuntos de datos nuevos y completamente reservados están resultando cruciales para la selección de modelos, en lugar de confiar en conjuntos de datos que la comunidad ha utilizado durante años.

El veredicto de Lilith

Cuando una métrica es pública, se convierte en el objetivo, y los modelos encontrarán la forma de piratearla. Transcribir el silencio de una chuleta no es inteligencia; es una excelente optimización para lo que no toca.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗