Lilith.
⌕
Redakční ilustrace: OpenAI zúžila GPT-6 Luna na tři typy rozhodnutí, plugin je zpřístupnil v terminálu
Ilustrace Lilith · redakční remix

OpenAI vydala Decisions API postavené na modelu GPT-6 Luna a Simon Willison pro ně zveřejnil plugin llm-openai-decisions 0.1a0 do svého CLI LLM. API přijímá text i obraz a vrací tři typy strukturovaných výstupů: pravděpodobnost pravdivosti tvrzení, volbu z předem daných možností nebo skóre na zadané škále.

GPT-6 Luna vrací pravděpodobnost místo odstavce textu

Willison ukazuje dotaz nad obrázkem, na který model odpoví JSON objektem s typem, názvem hodnocení a pravděpodobností. Plugin lze nainstalovat příkazem llm install llm-openai-decisions a pak volat ze stejného terminálového workflow jako ostatní modely podporované nástrojem LLM.

OpenAI účtuje 0,10 dolaru za milion vstupních tokenů a neúčtuje výstup. Koncepce se podobá modelu Jev od TypeSafe AI, který také podporuje binární otázky, volby a skóre. Podle Willisonova srovnání stojí Jev 0,042 dolaru za milion vstupních tokenů a pracuje s textem, zatímco GPT-6 Luna přidává obrazový vstup.

Samostatná rozhodovací vrstva zjednodušuje routing a třídění

Běžný generativní model musí nejprve vyrobit text a aplikace z něj často následně vytahuje kategorii nebo číslo. Decisions API dává vývojáři užší kontrakt. Hodí se pro směrování požadavků, prioritizaci fronty, moderování, reranking nebo hodnocení dokumentů podle pevně popsaných kritérií.

Praktický posun nespočívá v chytřejším chatu. Jde o levnou komponentu, kterou lze vložit mezi nestrukturovaný vstup a deterministickou část systému. Willisonův plugin je důležitý právě tím, že z produktové novinky dělá nástroj pro opakovatelné experimenty z příkazové řádky.

Jedno desetinné číslo může skrýt chybu i předsudek

Strukturovaný výstup usnadňuje integraci, ale zužuje možnost kontroly. Model vrátí pravděpodobnost nebo skóre, nikoli důvody a konkrétní signály, které rozhodnutí ovlivnily. V citlivém použití, například při třídění uchazečů nebo zákaznických sporů, nelze hladké API zaměnit za auditovatelnost.

Nízká cena navíc svádí k masovému nasazení dřív, než tým změří falešně pozitivní a falešně negativní případy na vlastních datech. Evals musí pokrýt hraniční vstupy, změny jazyka, obrazové podněty a pokusy o manipulaci obsahem.

Kalibrace na vlastních datech rozhodne o užitečnosti

Vývojáři by měli sledovat, zda skóre odpovídají skutečné pravděpodobnosti, jak stabilní jsou při drobných změnách promptu a zda lze nastavit bezpečné prahy pro eskalaci k člověku. Srovnání s Jev dává smysl provádět na stejné sadě úloh, protože nižší cena sama neříká nic o chybách.

Důležitým signálem bude také chování u obrazových vstupů, které OpenAI přidává nad rámec textového Jev. Pokud GPT-6 Luna udrží kalibraci napříč oběma modalitami a týmy dokážou rozhodnutí průběžně auditovat, úzké decision modely získají vlastní místo vedle generativních LLM.

Lilithin verdikt

GPT-6 Luna podá aplikaci čisté číslo, ale nenechá u něj svědeckou výpověď. Kdo podle něj třídí lidi nebo spory, musí mít člověka připraveného číslo zpochybnit.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗ ↗