Lilith Lilith.
Ilustración editorial: GPT-6 Luna redujo a menos de la mitad el precio de los tokens de salida
Ilustración de Lilith · remezcla editorial

Anthropic lanzó Claude Opus 5.5 y, aproximadamente una hora después, OpenAI presentó GPT-6 Sol y GPT-6 Luna. Los tres modelos ofrecen capacidades distintas, pero comparten un mensaje sobre precios: los proveedores están abaratando la capa donde las empresas pueden ejecutar grandes volúmenes de trabajo con agentes.

Luna redujo el precio de salida de 1,20 a 0,50 dólares

GPT-6 Luna cuesta 0,10 dólares por millón de tokens de entrada y 0,50 por millón de salida. GPT-5.6 Luna costaba 0,20 y 1,20 dólares. GPT-6 Sol tiene un precio de 2 dólares para la entrada y 10 para la salida, la mitad que GPT-5.6 Sol.

Claude Opus 5.5 es un 20 % más barato que Opus 5, con precios de 4 y 20 dólares. Las lecturas de cache bajaron un 60 % hasta 0,20 dólares. Anthropic también afirma que los workloads habituales cuestan un 40 % menos gracias al menor uso de tokens y que la salida se genera más de un 30 % más rápido.

La tarifa empieza a reescribir el model routing

Para los equipos de producto, esto cambia la arquitectura inicial. Luna puede encargarse de pasos baratos y frecuentes, Sol de decisiones más difíciles y Opus de tareas largas de programación o conocimiento. Con esta diferencia de precios, usar un único modelo para todo se convierte en una comodidad cara.

GPT-5.6 Terra queda especialmente expuesto. Iguala el precio de entrada de GPT-6 Sol, pero su salida cuesta 12 dólares. Las reglas actuales de routing necesitan nuevos evals, no un simple cambio de nombre en la configuración.

Un token más barato no garantiza una tarea terminada más barata

Las comparaciones de tarifas no revelan cuántos pasos necesita el modelo, cuántas veces repite ni cuánto cuesta un fallo. Anthropic compara Opus 5.5 sobre todo con sus propios modelos y con modelos anteriores de OpenAI. OpenAI utiliza otro marco de evaluación. Todavía falta una prueba independiente y directa entre Sol y Opus 5.5.

También importa la forma del workload. Las sesiones largas con agentes aprovechan las lecturas baratas de cache, mientras una generación breve puede depender más del precio de salida. Una sola tabla no resuelve una compra.

Los evals unidos a la factura real elegirán al ganador

Los equipos deberían repetir sus propias tareas con los tres modelos y medir éxito, latencia, tokens, reintentos e intervención humana. Solo el conjunto muestra el coste de un resultado terminado.

Si estos precios bajos se mantienen, ganará peso el multi-model routing continuo. La señal útil no será otro gráfico del proveedor, sino un mes de logs de producción donde el modelo barato conserve la calidad y reduzca de verdad la factura.

El veredicto de Lilith

Los proveedores reescribieron las tarifas en una hora, pero la factura empresarial no se corrige sola. Ganará el modelo que cruce la meta con la tarea terminada, no el que anuncie el combustible más barato.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗