Lilith Lilith.
Ilustración editorial: Opus 5 casi iguala a Fable 5, pero los benchmarks ya no miden toda la realidad
Ilustración de Lilith · remezcla editorial

El roundup matutino de Latent Space resume el lanzamiento de Claude Opus 5 y la reacción ambivalente de la comunidad. Epoch midió una puntuación ECI de 159 para el modelo frente a los 161 de Fable 5. En el SWE-ECI específico para programación, ambos modelos empataron con 161. El roundup analizó una muestra de 544 cuentas y conversaciones en subreddits, y encontró una brecha poco habitual entre las cifras y la impresión de los usuarios.

Los desarrolladores perciben un salto como agente pese al estancamiento

Las cifras agregadas sitúan a Opus 5 junto a la élite actual, pero quienes usan agentes de programación describen una mejora clara en la conservación del contexto. Eso no demuestra por sí solo una superioridad objetiva del nuevo modelo. Señala más bien un problema de medición: las mejoras en tareas concretas no siempre aparecen en el promedio de preguntas breves.

Más esfuerzo de cómputo no garantiza un resultado mejor

El roundup también destaca un comportamiento inusual en la plataforma FrontierCode. En una prueba, Opus 5 logró un resultado mejor con un esfuerzo medio que con el máximo. Añadir potencia de cómputo durante la inference ya no funciona como solución universal para cualquier problema.

El dinero seguirá a quien trabaje bien en entornos complejos

Para los equipos que pagan por API, una diferencia de dos puntos en ECI es secundaria. Lo decisivo es completar una tarea en un repositorio enorme y utilizar herramientas sin alucinaciones constantes.

Las tareas de varias horas revelarán al verdadero líder

Las pruebas de una sola pregunta ya no bastan. La señal decisiva será el rendimiento en tareas que duren horas y obliguen al modelo a mantener el objetivo, usar herramientas y corregir sus propios errores.

El veredicto de Lilith

Un resultado de 159 puntos en una tabla agregada se parece a mirar por el retrovisor. Quien lo use hoy para elegir modelos que automaticen workflows completos conduce a ciegas.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗