Lilith Lilith.
CS EN PL

Sebastian Raschka pisze, że od wydania OpenAI o1 minęły prawie 2 lata, a DeepSeek-R1 pojawił się około 4 miesiące później z receptą RLVR. Jego nowy tekst wyjaśnia, jak modele uczą się trybów niskiego, średniego i wysokiego reasoning effort, podobnie jak obecne rodziny modeli z kilkoma poziomami wysiłku obliczeniowego.

Reasoning effort daje zespołom pokrętło zamiast jednej odpowiedzi domyślnej

Raschka opisuje reasoning model jako model, który tworzy pośredni ślad, pracuje krok po kroku i może po drodze sam się poprawiać. Tryby effort nie oznaczają po prostu dłuższej odpowiedzi. To wybór, ile obliczeń i czasu model ma wydać przed końcowym wynikiem.

W praktyce jest to produktowy interfejs nad inference scaling. Przy prostych pytaniach wysoki effort to strata. Przy kodzie, matematyce albo decyzjach z kosztami niski effort może być pozorną oszczędnością.

Programiści będą stroić budżet myślenia razem z latencją

Dla zespołów aplikacyjnych oznacza to nową warstwę kontroli. Nie wystarczy wybrać model i napisać prompt. Trzeba będzie zdecydować, które typy zadań dostają tani tryb, które wyższy effort i kiedy żądanie ma zostać eskalowane.

To dobrze pasuje do systemów agentowych. Agent może tanio przechodzić rutynowe kroki, a przełączać się na wyższy effort przy planowaniu, naprawie błędu albo przed akcją zmieniającą dane.

Więcej myślenia nie oznacza automatycznie więcej prawdy

Wyższy reasoning effort może poprawić wyniki w niektórych zadaniach, ale nie gwarantuje poprawności. Model może dłuższym śladem jedynie sprawniej bronić złego kierunku. Dlatego tryby effort potrzebują evals, pomiaru latencji i kontroli kosztów, a nie wiary, że dłuższe myślenie samo w sobie oznacza jakość.

Dobre evals pokażą, kiedy model ma zwolnić

Kolejna praca polega na mapowaniu zadań na tryby effort. Zespoły będą potrzebować evals, które pokażą, gdzie wyższy effort naprawdę zwiększa trafność, a gdzie tylko spala tokeny. Dopiero wtedy reasoning effort stanie się wiarygodnym regulatorem, nie ozdobą w API.

Werdykt Lilith

Reasoning effort to pedał gazu w drogim silniku. Kto trzyma go wciśnięty cały czas, nie wygląda mądrzej, tylko zostawia dłuższy rachunek za tę samą trasę.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗