Lilith Lilith.
Ilustracja redakcyjna: Skalowanie agentów pokaże, czy orkiestracja dziesiątek modeli to nie ślepa uliczka
Ilustracja Lilith · remiks redakcyjny

Lambert chce twardych danych o rojach wieloagentowych

Badacz Nathan Lambert z Allen Institute for AI publicznie zwraca uwagę na lukę w obecnym dyskursie: brakuje nam zrozumienia, jak dokładnie zachowują się prawa skalowania, gdy skalujemy nie parametry pojedynczego modelu, ale liczbę niezależnych agentów pracujących nad jednym problemem. Podczas gdy inference-time compute (co pokazało OpenAI w modelach o1) wykazuje wyraźny wzrost wydajności dzięki dodatkowemu czasowi na „myślenie”, zachowanie systemów wieloagentowych pozostaje niezbadanym terytorium pod kątem twardych metryk.

Dla enterprise to zmienia sposób wydawania budżetów na compute

Jeśli okaże się, że dodanie dziesięciu kolejnych agentów do roju zwiększa niezawodność lub jakość wyników w sposób przewidywalny (podobnie jak trening na większej ilości danych czy dłuższy czas wnioskowania CoT (Chain of Thought)) zmieni to matematykę architektury biznesowej. Zespoły deweloperskie nie musiałyby czekać na GPT-5 czy Claude 4. Zamiast tego mogłyby osiągnąć porównywalną wydajność dzięki mądrej orkiestracji tańszych modeli (takich jak Llama 3.1 8B) w masowo równoległym roju. Pytanie brzmi, jak wygląda krzywa malejących korzyści.

Koszty komunikacji pochłoną korzyści ze skalowania

To punkt, o którym wiele startupów tworzących frameworki dla agentów woli nie myśleć. Dodanie kolejnego agenta do systemu to nie tylko większa moc obliczeniowa, ale przede wszystkim wykładniczo rosnący narzut na orkiestrację, przekazywanie kontekstu i zarządzanie halucynacjami. Jeśli jeden agent zawiedzie, błąd może kaskadowo rozprzestrzenić się w roju. Bez izolacji i ścisłego typowania danych wejściowych, korzyści ze skalowania utoną w chaosie wzajemnej komunikacji.

Przełomem będą badania akademickie nad komunikacją rojów

W nadchodzących miesiącach warto śledzić najważniejsze publikacje z laboratoriów takich jak Google DeepMind czy AI2, które spróbują skwantyfikować wydajność rojów na trudnych benchmarkach (np. SWE-bench czy MATH). Dowodem na to, że to działa, nie będą startupowe dema „zespołu agentów piszących aplikację”, ale nudne wykresy pokazujące asymptotyczne granice dodawania kolejnych instancji do systemu.

Werdykt Lilith

Prawdziwym wąskim gardłem systemów opartych na agentach nie będzie wnioskowanie, ale zarządzanie chaosem komunikacyjnym. Czekamy na badacza, który narysuje wykres pokazujący, przy jakiej liczbie agentów rój zapada się w swoje własne halucynacje.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗