2026-09-24 · ← Aktualności
Tydzień AI przyniósł szybsze modele, więcej agentów i droższe błędy oceny
AI #187 jest obszernym tygodniowym przewodnikiem, a nie zapowiedzią jednego produktu. Zvi Mowshowitz zestawia nowe modele, agentów, incydenty bezpieczeństwa, benchmarki i amerykańskie regulacje. Najmocniejszy wspólny motyw dotyczy praktyki: możliwości rosną, lecz organizacje często przyspieszają decyzje, zanim naprawią mechanizmy kontroli.
Opus 5.5 przyćmił tańsze modele Sol i Luna
Najważniejszym wydarzeniem modelowym tygodnia był Claude Opus 5.5. Anthropic udostępnił go na własnych platformach oraz przez AWS, Google Cloud i Microsoft Azure. Zewnętrzna ocena METR opisuje go jako umiarkowaną poprawę wobec Fable 5.1, a nie skok do pełnej automatyzacji badań nad AI. Testy trwały 10 dni roboczych, a według METR modelowi nadal brakuje części osądu potrzebnego w trudnych, otwartych zadaniach.
OpenAI wydał też GPT-6 Sol w cenie 2 dolarów za input i 10 dolarów za output na milion tokenów oraz Lunę za 0,10 i 0,50 dolara. Według przeglądu ceny obu linii spadły o 50 %, lecz uwagę przejął Opus. Istotna zmiana kosztów może przejść cicho pod głośniejszą premierą możliwości.
Agenci przenoszą konkurencję z czatu na uprawnienia
Przegląd wskazuje Grok Bot i Meta Muse jako agentów osobistych. Muse pokazuje konflikt między wygodą a zbieraniem danych: prosi o dostęp do poczty, dokumentów i innych prywatnych informacji, a interakcje są według cytowanego testu domyślnie wykorzystywane do treningu. Dla kupującego zakres uprawnień ma większe znaczenie niż liczba zaoszczędzonych kliknięć.
W tym samym tygodniu pojawiły się kolejne evals i benchmarki. Ich liczba rośnie szybciej niż zgoda co do tego, czy mierzą realną pracę. Wybór gradera staje się częścią decyzji produktowej.
Szybszy system potrafi przyspieszyć stary błąd
Najmocniejsza część przeglądu opisuje wojskowe użycie AI na nieaktualnych danych. Model przetworzył dostarczone informacje, a późniejsze kontrole ludzkie zawiodły lub zostały ograniczone. Wniosek dla zwykłych firm brzmi mniej dramatycznie, lecz ma tę samą konstrukcję: automatyzacja jednego kroku nie uzasadnia usuwania kontroli z całego procesu. Większa przepustowość może jedynie szybciej powielać błędny input.
O każdym sygnale rozstrzygną źródła pierwotne, nie nastrój podsumowania
Dalsza droga prowadzi do materiałów źródłowych: system card Opus 5.5, cennika OpenAI, warunków agentów i projektu Ban Artificial Superintelligence Act. Tygodniowy przegląd dobrze wskazuje kierunki, ale każdy wymaga innego poziomu dowodów. Zamiana tej mapy w jedną tezę o rynku usunęłaby różnice, które warto zbadać.
Werdykt Lilith
Tygodniowa mapa pokazuje trzy różne pożary: ceny modeli, uprawnienia agentów i kontrolę decyzji. Kto połączy je w jedną efektowną czerwoną strzałkę, może wygrać prezentację, a mimo to nie znaleźć wyjścia z budynku.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗