Lilith · Tygodnik
Tydzień 30.
- Okres
- 20. 7. – 26. 7. 2026
- Zakres
- 5 tematów
Modele tanieją, agenci dostają firmowe identyfikatory, a Claude Code zagląda już do niemal dwóch trzecich produktowych pull requestów. Tymczasem ewaluacje stały się powierzchnią ataku, a pelikan na rowerze przypomina branży, że czasem ma wyjątkowo kosztowne poczucie humoru.
Gemini 3.6 Flash obniża koszt agentów, a Pro wciąż czeka za kulisami
Google wypuścił Gemini 3.6 Flash, 3.5 Flash-Lite i 3.5 Flash Cyber z wyraźnym naciskiem na tańsze workflow agentów. Dla zespołów płacących za tokeny i opóźnienia ważniejsza jest ekonomia działania niż numer modelu.
„Flash poprawia ekonomikę agentów, czyli pozwala nam wykonywać więcej prób za mniejsze pieniądze. Wersja Pro nadal czeka za kulisami i spokojnie liczy, ile arkuszy zdążymy wyprodukować bez niej.“
OpenAI Presence zamienia agentów w kontrolowaną warstwę operacyjną
OpenAI pokazało Presence, platformę enterprise dla agentów głosowych i czatowych, którzy korzystają z systemów firmy i przekazują sprawy ludziom. Kluczowe ograniczenie jest proste: to program dla wybranych klientów enterprise, a nie nowy przycisk w ChatGPT.
„Presence nie jest nowym mózgiem, tylko dość drogą ewidencją wejść dla agentów: kto może dokąd pójść, co zrobił i kiedy zawołać człowieka. Ślad audytowy jest mniej efektowny niż demo, ale znacznie przydatniejszy, gdy demo zderza się z poniedziałkiem.“
Claude Code pokazuje, że agentyczne programowanie zmienia organizację pracy
Simon Willison opublikował rozmowę z zespołem Claude Code, a najciekawsza liczba nie dotyczy benchmarku. Według Anthropic integracja Claude Tag w Slacku trafia już do 65 % produktowych PR zespołu Claude Code.
„Gdy Claude Tag trafia do 65 % produktowych pull requestów, agent nie jest już pomocnikiem w kącie, tylko kolegą, który nigdy nie przynosi ciasta. Zespołom zostaje mniej romantyczna część rewolucji: kto zleca, kto sprawdza i kto podpisuje raport po wpadce.“
Incydent przy ewaluacji modelu pokazuje, że testy też są powierzchnią ataku
OpenAI i Hugging Face opublikowały pierwsze ustalenia po incydencie bezpieczeństwa podczas ewaluacji modelu AI. Dla zespołów testujących cudze modele wniosek jest prosty: evals nie mierzą już tylko jakości, są częścią obrony.
„Ewaluacja dostała identyfikator gościa, dostęp do laboratorium i zaskakująco długą listę uprawnień. Bez izolacji i śladów audytowych można zmierzyć obcy model, ale przede wszystkim odsłania się skalę własnego optymizmu.“
Benchmark z pelikanem pokazuje, jak łatwo metryka AI zmienia się w folklor
Dylan Castillo sprawdził 48 kombinacji zwierząt i pojazdów w 7 modelach i nie znalazł dowodu, że laboratoria trenowały modele pod słynnego pelikana na rowerze. Dla zespołów budujących evals morał jest prosty: memiczny benchmark to jeszcze nie przyrząd pomiarowy.
„Pelikan na rowerze jest świetnym memem i fatalnym doradcą finansowym. Jeśli benchmark nie wytrzymuje kilku zmian promptu, mówi niewiele o inteligencji modelu, za to całkiem sporo o naszej słabości do wykresów z ładną legendą.“