2026-09-26 · ← Noticias
Claude Opus 5.5 convierte la ambición en una métrica de producto
Anthropic presenta Claude Opus 5.5 como el primer modelo de su nueva familia 5.5. Afirma que alcanza el rendimiento de Fable 5.1 en la mayoría de tareas y que una carga típica cuesta un 40 % menos que con Opus 5. Para los equipos, la cuestión más útil es si su mayor constancia y su comunicación más clara permiten delegar bloques de trabajo mayores.
Anthropic ofrece rendimiento de Fable con un menor coste de Opus
El discurso oficial combina agentic coding, knowledge work y periodos más largos de trabajo autónomo. Anthropic sostiene que Opus 5.5 se comunica de forma más natural, presenta primero la información principal y respeta mejor las normas de estilo. También estima un coste un 40 % inferior al de Opus 5 en cargas típicas.
Las primeras reacciones recopiladas por Zvi Mowshowitz destacan con frecuencia la velocidad, las respuestas más legibles y la capacidad de continuar sin recordatorios constantes. Son cualidades que un benchmark mide peor que la precisión de una respuesta.
Una mayor ambición exige delegar paquetes completos de trabajo
La ventaja para el desarrollador va más allá de un completion mejor. Un modelo que conserva el objetivo, mantiene una lista de tareas y explica con claridad su progreso puede recibir una corrección completa o un prototipo, no solo un archivo. El humano pasa entonces de redactar instrucciones a definir el resultado y revisar cambios.
El menor coste de una carga típica refuerza ese cambio. Si un equipo puede financiar más intentos, pruebas y revisiones, la constancia se convierte en una ventaja económica.
El entusiasmo del lanzamiento todavía no mide la fiabilidad
Las pruebas proceden sobre todo de experiencias iniciales y benchmarks del proveedor. También hay informes sobre iniciativa excesiva, peor lectura de intenciones implícitas y modos max thinking capaces de consumir tantos tokens que eliminan la ventaja de precio. Un agente dispuesto a seguir puede avanzar con la misma energía en la dirección equivocada.
Los proyectos terminados pesarán más que otra clasificación
Los equipos deberían medir las intervenciones humanas, el coste por tarea terminada, las regresiones y la calidad del traspaso tras varias horas. Si Opus 5.5 aumenta de verdad el tamaño de una tarea delegable con seguridad, se verá en una cola de review más corta y en menos devoluciones, no solo en una ventaja de benchmark.
El veredicto de Lilith
Opus 5.5 promete que una persona podrá encargar la casa entera en vez de un solo ladrillo. Lo decisivo será cuántas veces deba volver el constructor para comprobar si el agente ha cambiado la escalera de sitio.
Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.
Fuente original ↗ ↗