Lilith Lilith.
Ilustracja redakcyjna: Google omija wąskie gardło inferencji: Retrieve-for-Train taniej rozwiązuje złożone wyszukiwania
Ilustracja Lilith · remiks redakcyjny

Model myśli z góry, nie przy każdym zapytaniu

Google Research przedstawił nowy framework Retrieve-for-Train, który rozwiązuje problem rosnących kosztów złożonego wyszukiwania AI. Zamiast pozwalać modelowi językowemu na skomplikowane rozumowanie przy każdym zapytaniu w czasie rzeczywistym, Google wykorzystuje reinforcement learning do stworzenia lekkiego modelu dyfuzyjnego. Potrafi on wygenerować spójny pakiet eksperckich wyników znacznie taniej, ponieważ ciężka praca obliczeniowa została wykonana już podczas treningu.

Koniec brutalnej siły w warstwie runtime

Ekonomia wyszukiwania AI osiąga swój limit. Modele takie jak o1 od OpenAI pokazują, że więcej czasu obliczeniowego podczas inferencji („budżet myślenia”) prowadzi do lepszych wyników, ale w skali globalnej wyszukiwarki jest to finansowo nie do utrzymania. Retrieve-for-Train omija ten problem, przenosząc obciążenie obliczeniowe z warstwy runtime z powrotem do fazy treningu. Dla zespołów produktowych oznacza to możliwość zaoferowania głębszej analizy nawet użytkownikom bez subskrypcji premium.

Tani model nie potrafi wszystkiego

Przeniesienie logiki do modelu dyfuzyjnego ma jednak swój haczyk. Lekki model wytrenowany przez RL świetnie radzi sobie z zadaniami, które widział już w rozkładzie danych treningowych, ale w przeciwieństwie do pełnego LLM nie potrafi dobrze reagować na zupełnie nieoczekiwane typy zapytań (zadania out-of-distribution). Efektem jest szybki system, który w skrajnych przypadkach może jednak halucynować z większą pewnością siebie niż ciężki model.

Wdrożenie na lokalnym sprzęcie

Kluczową metryką będzie to, czy Google zdoła przenieść tę technologię na urządzenia mobilne. Prawdziwym dowodem na to, że framework działa, nie będzie kolejny benchmark, ale zdolność do lokalnego uruchamiania podobnie złożonych wyszukiwań na telefonach Pixel bez konieczności spalania mocy w chmurze.

Werdykt Lilith

Zdolność zbicia kosztów runtime do zera gotowym modelem oznacza, że zwycięzca może zaoferować masom darmową inteligencję premium i zagłodzić konkurencję.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗