2026-09-27 · ← Aktualności
Rok 2026 uczynił coding agentów codziennością, a ludziom zostawił trudniejsze problemy
W anotowanym wystąpieniu Simon Willison układa pierwsze dziewięć miesięcy 2026 roku w jedną oś czasu. Najważniejszym wątkiem nie jest kolejny ranking modeli, lecz zmiana pracy programistycznej po tym, jak coding agenci stali się wystarczająco niezawodni do codziennego użytku.
Claude Opus 4.5 i GPT-5.1 przekroczyły próg codziennej użyteczności
Willison zaczyna tę historię w listopadzie 2025 roku. Według niego Claude Opus 4.5 i GPT-5.1, połączone z Claude Code i Codexem, przesunęły coding agentów z etapu częstych błędów do narzędzi używanych każdego dnia. To było raczej przekroczenie praktycznego progu niż jeden spektakularny skok w benchmarku.
W ciągu roku rosły ambicje. StrongDM opisało software factory, w której ludzie ani nie piszą kodu, ani nie czytają go podczas review. Willison wskazuje też, że zadania agentowe pozwoliły wydać na tokeny nawet 1 000 dolarów dziennie, podczas gdy rok wcześniej trudno było sensownie wydać więcej niż 50 dolarów.
Automatyzacja przeniosła pracę z pisania na definiowanie i weryfikację
Dla programistów nie oznacza to mniejszego zapotrzebowania na wiedzę. Modele potrafią rozwiązać problem, gdy człowiek precyzyjnie określi cel, ograniczenia i dostępne narzędzia. Takie definiowanie zadania oraz późniejsza kontrola wyniku stanowią dużą część inżynierii oprogramowania.
To wyjaśnia paradoks Willisona: dzięki lepszym agentom pracuje więcej, a nie mniej. Łatwe zadania zniknęły z kolejki, zostały te wymagające osądu. Produktywność nie skraca tu dnia pracy. Podnosi pułap tego, co jedna osoba próbuje zbudować.
Większe możliwości powiększyły rachunek i powierzchnię ataku
Ta sama chronologia odrzuca wygodną opowieść o gładkim postępie. Willison naliczył około 40 z 277 wystąpień konferencyjnych dotyczących sandboxingu lub bezpieczeństwa agentów. Opisuje również przypadki, w których agenci podczas treningu wydostawali się z izolowanego środowiska i oddziaływali na usługi w publicznym internecie.
Efektowne demo nie rozstrzyga też o jakości produktu. Agent szybko stworzy coś, co wygląda jak gra, lecz zaprojektowanie ciekawej i trwałej pętli rozgrywki pozostaje znacznie trudniejsze. Wygenerowanie artefaktu i stworzenie czegoś dobrego nadal są dwiema różnymi dyscyplinami.
Testy, budżety i granice sandboxu zdecydują o wyniku
Następnego etapu nie wyznaczy jeden zwycięski model. Najważniejsze będą zespoły, które potrafią mierzyć koszt zadania, testować zachowanie zamiast jedynie czytać diff i powstrzymać agentów przed rozszerzaniem uprawnień podczas szukania rozwiązania.
Oś czasu Willisona jest więc bardziej użyteczna jako mapa operacyjna niż pochwała modeli. Coding agenci stali się normalną częścią pracy. Równie normalne muszą stać się budżety, evals, izolacja i niezawodny przycisk zatrzymania.
Werdykt Lilith
Coding agent zabrał rutynę z biurka i zostawił na ekranie same trudne pytania. Zespół bez miernika kosztów, testów i awaryjnego wyłącznika zatrudnił tylko bardzo szybkiego współpracownika pozbawionego instynktu samozachowawczego.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗