2026-09-22 · ← Noticias
Opus 5.5 en modo max agotó 128 000 tokens con un solo pelícano
Simon Willison encargó la misma tarea a los nuevos Claude Opus 5.5, GPT-6 Sol y GPT-6 Luna: producir un SVG de un pelícano en bicicleta. La prueba no mide inteligencia general. Sí permite observar diferencias entre niveles de reasoning effort dentro de una familia porque el prompt permanece fijo.
Una semana de lanzamientos abrió una guerra de precios bajo la cima absoluta
GPT-6 Sol cuesta en la API 2 dólares por millón de tokens de entrada y 10 dólares por millón de salida. GPT-6 Luna cuesta 0,10 y 0,50 dólares respectivamente. En la comparación de Willison, ambos cuestan aproximadamente la mitad que sus equivalentes de GPT-5.6.
Claude Opus 5.5 rebajó un 20 % el precio de Opus 5, hasta 4 dólares por millón de tokens de entrada y 20 dólares por millón de salida. Las lecturas de cache bajaron un 60 %, hasta 0,20 dólares. La pugna se concentra así por debajo de GPT-6 Astra y Claude Fable 5.1, que se mantienen en 10 y 50 dólares.
La misma tarea absurda reveló lo que ocultan las tablas de benchmarks
El pelícano de Willison no es una clasificación entre proveedores. Como sonda repetible, sin embargo, mostró un fallo operativo: Opus 5.5 con esfuerzo max razonó hasta alcanzar el límite de 128 000 tokens de salida y no entregó el SVG terminado. Ocurrió dos veces. Cada intento costó 2,56 dólares y duró casi 20 minutos.
Para quien desarrolla una aplicación, ese dato resulta más útil que otra décima en un benchmark. Si una aplicación permite elevar libremente el effort, también debe limitar el tiempo, el coste y los pasos. De lo contrario, comprará un silencio más caro.
Un solo pelícano no invalida todo el ajuste max
La prueba es deliberadamente extraña y no demuestra que Opus 5.5 falle en tareas largas de programación. Anthropic comunica mejores resultados en agentic coding y menor coste en workloads habituales. Son cifras del proveedor y de evaluadores tempranos, no una garantía universal.
El episodio identifica un failure mode concreto: más reasoning no produce automáticamente un mejor resultado. Sin un stop condition adecuado, el modelo puede consumir todo su margen planificando un detalle que no aporta valor al usuario.
Los logs de producción deben medir el coste de una tarea terminada
Las próximas comparaciones deberían registrar tasa de éxito, tokens totales, tiempo y coste por tarea completada en cada nivel de effort. El precio por millón de tokens no indica cuántos consumirá un agente antes de responder.
Para los equipos, la señal útil es la proporción de tareas acabadas con un presupuesto fijo y la frecuencia de intervención humana. Un modelo más barato en la tarifa puede salir más caro en producción si sigue dando vueltas sobre un único pelícano.
El veredicto de Lilith
En la tarifa, max effort parece un motor más potente. Sin limitador, Opus 5.5 quemó dos veces 2,56 dólares y casi 20 minutos antes de que el pelícano saliera del garaje.
Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.
Fuente original ↗ ↗