Lilith.
⌕
Ilustración editorial: Haiku 5.5 rebaja un 90 % las tareas cortas, pero cobra más por el contexto largo
Ilustración de Lilith · remezcla editorial

Anthropic ha lanzado Claude Haiku 5.5 como modelo rápido para grandes volúmenes de tareas cortas. El precio por debajo de 100.000 tokens cae un 90 % respecto a Haiku 4.5, pero la nueva tarifa también crea un límite brusco que puede cambiar la economía de los agentes que trabajan durante más tiempo.

Haiku 5.5 cuesta una décima parte por debajo de 100.000 tokens

Anthropic cobra 0,10 dólares por millón de tokens de entrada y 0,50 dólares por millón de tokens de salida. Por encima de 100.000 tokens en el prompt, las tarifas suben a 0,50 y 2,50 dólares. La empresa afirma que cerca del 90 % de las solicitudes de Haiku 4.5 quedaban por debajo de ese límite y calcula un ahorro medio aproximado del 75 %.

El modelo incorpora un nivel de esfuerzo ajustable y utiliza medium de forma predeterminada. Anthropic lo ofrece en Claude Platform y a través de Amazon Web Services, Google Cloud y Microsoft Azure. Para programación agéntica compleja, sigue recomendando Sonnet 5.5 y Opus 5.5.

Su mejor papel es el de trabajador barato detrás del sistema

Haiku 5.5 se orienta a resúmenes, clasificación, consultas de bases de datos, soporte y tareas acotadas de subagentes. En esos usos, el bajo precio permite ejecutar el modelo con más frecuencia o dividir el trabajo entre varias llamadas especializadas.

Para los equipos importa más un routing fiable que encontrar un único modelo universal. Un modelo más potente puede planificar y Haiku encargarse de los pasos repetitivos. El ahorro procede entonces de la arquitectura del workflow, no solo de una tarifa inferior.

Un prompt largo borra buena parte de la ventaja económica

Simon Willison señala que el precio se multiplica por cinco al superar los 100.000 tokens. En su propia prueba, el mismo prompt largo también consumió cerca de 1,25 veces más tokens que Haiku 4.5 debido al nuevo tokenizer. Una rebaja de tarifa no equivale necesariamente a un menor coste por tarea terminada.

Los benchmarks los ha publicado el proveedor, y el resultado real depende del esfuerzo, la longitud del contexto, la cache y los reintentos. Un token barato no ayuda si el modelo pequeño debe repetir varias veces el mismo trabajo.

Los evals internos deben medir el coste de la tarea terminada

La métrica decisiva será el coste por caso resuelto, no la tarifa por millón de tokens. Los equipos deberían medir por separado las tareas rutinarias cortas, los prompts largos y las ejecuciones que requieren escalar a Sonnet u Opus.

Si Haiku 5.5 mantiene la calidad con esfuerzo bajo y contexto corto, puede abaratar mucho los subagentes. Si el contexto supera con frecuencia los 100.000 tokens, la ventaja se reducirá deprisa.

El veredicto de Lilith

Haiku 5.5 es un corredor barato de distancias cortas cuyo peaje sube con fuerza después de 100.000 tokens. Quien le cargue un archivo entero sin medir puede encontrar una factura muy distinta en la meta.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗ ↗