Lilith.
⌕
Ilustración editorial: OpenAI limita GPT-6 Luna a tres tipos de decisión y un plugin los lleva al terminal
Ilustración de Lilith · remezcla editorial

OpenAI ha publicado Decisions API sobre GPT-6 Luna y Simon Willison ha lanzado la versión 0.1a0 de llm-openai-decisions para su CLI LLM. La API acepta texto e imágenes y devuelve tres clases de salida estructurada: la probabilidad de que una afirmación sea cierta, una elección entre opciones definidas o una puntuación dentro de una escala.

GPT-6 Luna devuelve una probabilidad en lugar de un párrafo

Willison muestra una consulta sobre una imagen que devuelve un objeto JSON con el tipo de respuesta, el nombre de la evaluación y una probabilidad. El plugin se instala con llm install llm-openai-decisions y permite usar el modelo en el mismo flujo de terminal que otros proveedores compatibles con LLM.

OpenAI cobra 0,10 dólares por millón de tokens de entrada y nada por la salida. El concepto se parece a Jev, de TypeSafe AI, que también admite respuestas binarias, elecciones y puntuaciones. La comparación de Willison sitúa Jev en 0,042 dólares por millón de tokens de entrada con texto, mientras GPT-6 Luna añade imágenes.

Una capa específica de decisión simplifica routing y clasificación

Un modelo generativo general produce texto que la aplicación suele tener que convertir después en una categoría o un número. Decisions API ofrece un contrato más estrecho. Encaja en routing de solicitudes, prioridad de colas, moderación, reranking y evaluación documental con criterios fijos.

El cambio práctico no es un chat más inteligente. Es un componente barato entre una entrada no estructurada y la lógica determinista de una aplicación. El plugin de Willison importa porque convierte un anuncio en una herramienta que los desarrolladores pueden probar repetidamente desde la línea de comandos.

Un solo decimal puede ocultar errores y sesgos

La salida estructurada facilita la integración, pero reduce la visibilidad de la decisión. El modelo devuelve una probabilidad o puntuación, no los motivos ni las señales concretas que influyeron. En usos sensibles, como ordenar candidaturas o resolver disputas con clientes, una API limpia no equivale a capacidad de auditoría.

El bajo precio también puede impulsar despliegues amplios antes de medir falsos positivos y negativos con datos propios. Los evals deben cubrir casos límite, cambios de idioma, imágenes e intentos de manipulación mediante el contenido enviado.

La calibración con datos propios decidirá su valor práctico

Los desarrolladores deberían comprobar si las puntuaciones coinciden con las probabilidades observadas, su estabilidad ante pequeños cambios del prompt y la posibilidad de fijar umbrales seguros para escalar casos dudosos a una persona. La comparación con Jev debe usar las mismas tareas, porque un precio inferior no mide el coste de los errores.

El comportamiento con imágenes será otra señal importante, ya que OpenAI amplía el formato más allá del texto de Jev. Si GPT-6 Luna mantiene la calibración en ambas modalidades y los equipos pueden auditar resultados de forma continua, los decision models especializados ganarán un lugar propio junto a los LLM generativos.

El veredicto de Lilith

GPT-6 Luna entrega a la aplicación una cifra limpia, pero no deja una declaración junto a ella. Quien la use para clasificar personas o disputas necesita a alguien dispuesto a impugnarla.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗ ↗