Lilith Lilith.
⌕
Ilustración editorial: Opus 5.5 recupera lo que los benchmarks no miden: la personalidad
Ilustración de Lilith · remezcla editorial

Ethan Mollick describe Opus 5.5 como un regreso a la experiencia del antiguo Claude. A su juicio, los modelos Opus entre las versiones 4.7 y 5 perdieron parte de su personalidad característica y se parecían a una versión diluida de Fable. Es la experiencia de un usuario, no una medición. Aun así, señala un punto ciego de las clasificaciones actuales.

Anthropic admite que la tabla solo cuenta una parte de la historia

Anthropic lanzó Opus 5.5 el 22 de septiembre de 2026. La empresa afirma que el modelo se comunica de forma más natural, presenta primero la información importante y responde a las críticas sobre la escritura densa de Opus 5. También reconoce que, con el nivel actual de capacidad, las diferencias en benchmarks son una guía menos fiable para distinguir el rendimiento en el trabajo real.

La versión incluye cambios más fáciles de medir. Anthropic asegura que las cargas de trabajo habituales cuestan un 40 % menos que con Opus 5 y que la generación es más de un 30 % más rápida. La API cuesta 4 dólares por millón de tokens de entrada y 20 dólares por millón de tokens de salida. El modelo está disponible en Anthropic, AWS, Google Cloud y Microsoft Azure.

El estilo del modelo determina el coste de las correcciones humanas

En tareas largas, la personalidad tiene consecuencias prácticas. Afecta a si el modelo reconoce la incertidumbre, cómo ordena un argumento y cuánto texto debe reescribir una persona. Dos modelos con la misma puntuación pueden imponer costes muy distintos en horas de edición, desarrollo o análisis.

La publicación de Mollick añade la perspectiva del usuario a las cifras del proveedor. Anthropic mide tokens, velocidad y éxito en tareas. El usuario también mide si puede colaborar con el modelo durante tres horas sin corregir constantemente su tono y su criterio.

La sensación de regreso aún descansa en anécdotas y afirmaciones del proveedor

Claude-like carece de una métrica estandarizada. Mollick no publicó una prueba ciega ni un conjunto de prompts, mientras que Anthropic cita a sus early testers. La mejora de estilo puede reflejar un cambio real del modelo, el efecto del system prompt o simplemente la novedad de una versión reciente.

Una comunicación más natural también puede separarse de la precisión. Una respuesta fluida se lee mejor, pero la fluidez por sí sola no demuestra que el modelo corrija errores, siga instrucciones o resista mejor la adulación.

Las preferencias ciegas y las sesiones largas dirán si Claude ha vuelto

Las señales útiles serán las comparaciones ciegas repetidas sobre tareas idénticas y las sesiones de trabajo reales. Conviene medir las correcciones humanas, la estabilidad del tono durante decenas de turnos y la disposición del modelo a cambiar de postura ante nuevas pruebas.

Si la preferencia se mantiene entre usuarios y sectores, los laboratorios tendrán que medir la consistencia de la colaboración junto con la capacidad. El benchmark seguirá siendo un marcador, no una descripción completa del producto.

El veredicto de Lilith

Una tabla puede ordenar modelos. Sabremos que Claude ha vuelto de verdad cuando, tras una sesión de tres horas, un compañero borre menos correcciones de la pizarra.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗ ↗