2026-10-07 · ← Aktualności
OpenAI ograniczyło GPT-6 Luna do trzech typów decyzji, a plugin przeniósł je do terminala
OpenAI udostępniło Decisions API oparte na GPT-6 Luna do odpowiedzi binarnych, wyboru opcji i ocen liczbowych. Plugin Simona Willisona pokazuje zaletę oraz cenę tego formatu: uporządkowane decyzje za 0,10 dolara za milion tokenów wejściowych nie wyjaśniają, dlaczego model wybrał właśnie tak.
Nie udało się wczytać obrazu.
OpenAI udostępniło Decisions API oparte na GPT-6 Luna, a Simon Willison opublikował wersję 0.1a0 pluginu llm-openai-decisions do swojego CLI LLM. API przyjmuje tekst i obrazy, a zwraca trzy rodzaje uporządkowanych wyników: prawdopodobieństwo prawdziwości stwierdzenia, wybór z podanych opcji albo ocenę na określonej skali.
GPT-6 Luna zwraca prawdopodobieństwo zamiast akapitu
Willison pokazuje zapytanie dotyczące obrazu, na które model odpowiada obiektem JSON zawierającym typ odpowiedzi, nazwę oceny i prawdopodobieństwo. Plugin instaluje się poleceniem llm install llm-openai-decisions, po czym model działa w tym samym terminalowym workflow co inni dostawcy obsługiwani przez LLM.
OpenAI pobiera 0,10 dolara za milion tokenów wejściowych i nie nalicza opłaty za wyjście. Koncepcja przypomina Jev firmy TypeSafe AI, który również obsługuje pytania binarne, wybory i oceny. W porównaniu Willisona Jev kosztuje 0,042 dolara za milion tokenów wejściowych i przyjmuje tekst, natomiast GPT-6 Luna dodaje obrazy.
Osobna warstwa decyzyjna upraszcza routing i klasyfikację
Ogólny model generatywny tworzy tekst, z którego aplikacja często musi ponownie wydobyć kategorię lub liczbę. Decisions API daje programiście węższy kontrakt. Nadaje się do routingu zgłoszeń, ustalania priorytetów kolejki, moderacji, rerankingu i oceny dokumentów według stałych kryteriów.
Praktyczna zmiana nie polega na lepszym czacie. Chodzi o tani komponent między nieuporządkowanym wejściem a deterministyczną logiką aplikacji. Plugin Willisona zamienia komunikat produktowy w narzędzie do powtarzalnych eksperymentów z wiersza poleceń.
Jedna liczba po przecinku może ukryć błąd i uprzedzenie
Uporządkowany wynik ułatwia integrację, lecz ogranicza wgląd w decyzję. Model zwraca prawdopodobieństwo albo ocenę, a nie powody i konkretne sygnały, które na nią wpłynęły. W zastosowaniach wrażliwych, takich jak porządkowanie kandydatów do pracy czy sporów z klientami, czystego API nie wolno mylić z audytowalnością.
Niska cena może skłaniać do szerokiego wdrożenia przed pomiarem fałszywych wyników na własnych danych. Evals powinny obejmować przypadki graniczne, zmianę języka, wejścia obrazowe oraz próby manipulacji treścią.
Kalibracja na własnych danych rozstrzygnie o użyteczności
Programiści powinni sprawdzić, czy oceny odpowiadają obserwowanym prawdopodobieństwom, jak reagują na drobne zmiany promptu i czy można ustawić bezpieczne progi przekazania sprawy człowiekowi. Porównanie z Jev wymaga tej samej puli zadań, bo niższa cena tokenów nic nie mówi o koszcie błędów.
Ważnym sygnałem będzie także zachowanie przy obrazach, które OpenAI dodaje do tekstowego formatu Jev. Jeśli GPT-6 Luna zachowa kalibrację w obu modalnościach, a zespoły zdołają stale audytować wyniki, wyspecjalizowane decision models znajdą własne miejsce obok generatywnych LLM.
Werdykt Lilith
GPT-6 Luna podaje aplikacji czystą liczbę, ale nie dołącza zeznania świadka. Kto używa jej do klasyfikowania ludzi lub sporów, potrzebuje człowieka gotowego tę liczbę podważyć.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗