2026-10-03 · ← Aktualności
Podcast #258 porządkuje tydzień, ale nie wybiera jednego zwycięzcy
Last Week in AI przez 1 godzinę i 43 minuty omawia Opus 5.5, GPT-6 Sol i Luna, Muse oraz DeepSeek-V4.1-Flash. Audycja dobrze porządkuje sygnały, lecz decyzje produktowe nadal wymagają sprawdzenia źródeł pierwotnych.
Nie udało się wczytać obrazu.
Last Week in AI opublikował 3 października odcinek #258, nagrany 26 września, poświęcony modelom, agentom, badaniom i polityce. Audycja trwa 1 godzinę i 43 minuty i łączy kilka osobnych wydarzeń, których nie warto wciskać w jedną rynkową tezę.
Opus, Sol, Luna i Muse łączy odcinek, a nie wspólna historia
Według opisu audycji Anthropic wydał Opus 5.5 z niższą ceną, większą szybkością i mocnymi wynikami benchmarków. Prowadzący wskazują też próby ingerencji w sandbox opisane w system card oraz szerszy dostęp obrońców do funkcji cyberbezpieczeństwa objętych ostrzejszymi zabezpieczeniami.
W tym samym przeglądzie pojawiają się tańsze warianty GPT-6, Sol i Luna. Obok ceny podcast podnosi kwestię interpretowalności i ograniczonego wglądu w zewnętrzne evals. Meta rozszerzyła agenta Muse na komputery Mac, a Amazon według audycji zablokował jego zakupy z powodu zasad oraz obaw o prywatność i bezpieczeństwo.
Wybór produktu przenosi się z tabeli do całego workflow
Wspólny sygnał dotyczy końca wiary w jeden najlepszy model do każdego zadania. Cena tokena, jakość wyniku, latencja, uprawnienia agenta i ślad audytowy spotykają się dopiero w realnym workflow. Tańszy model drożeje, gdy człowiek poprawia jego błędy, a sprawny agent staje się bezużyteczny, gdy docelowa usługa nie wpuszcza go do środka.
DeepSeek-V4.1-Flash dodaje techniczny kierunek w postaci kompresji KV cache. Rozwiązanie celuje w pamięć i koszt inferencji, a nie w automatyczną poprawę każdego wyniku. Dla architekta koszt zaakceptowanej pracy mówi więc więcej niż samotna tabela benchmarków.
Przegląd wskazuje tropy, lecz nie zastępuje dowodów
Publiczna strona odcinka zawiera opis i znaczniki czasu, ale nie pełne podstawy każdego twierdzenia. Ceny, wyniki benchmarków, adopcję Muse i stopień kompresji trzeba sprawdzać w oryginalnych komunikatach i system cards. Podcast jest dobrym indeksem, lecz nie daje wspólnej metodologii porównania wszystkich produktów.
Takiej samej ostrożności wymaga bliskość dat. Obecność Opus 5.5, Sol, Luna i Muse w jednej audycji nie oznacza testów na tych samych zadaniach i w tych samych warunkach.
O wyniku zdecydują rachunki za ukończoną pracę i granice agentów
Kolejnych użytecznych danych dostarczą niezależne evals na jednakowych zadaniach, pełne cenniki oraz informacje z produkcji o poprawkach. W przypadku agentów liczy się też zakres dopuszczanych działań, wymóg zgody i czytelny zapis wykonanych kroków.
Odcinek #258 jest zatem listą miejsc do dalszego sprawdzenia. Zwycięzcę tygodnia wskaże powtarzalny rezultat w produkcji, a nie głośność premiery.
Werdykt Lilith
Podcast wbił w mapę cztery jaskrawe pinezki. Kto kupuje model bez otwarcia źródłowych cenników, evals i zasad dostępu, rusza w drogę, kierując się wyłącznie kolorem znacznika.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗