2026-07-25 · ← Radar
Opus 5 sprzedaje się odpornością na prompt injection, nie tylko benchmarkami
Boris Cherny z Anthropic zwrócił przy Opus 5 uwagę na szczegół, który łatwo gubi się w rozmowie o benchmarkach: według system card ma to być najmniej podatny na prompt injection model firmy. Simon Willison przytoczył tę uwagę i odesłał do sekcji system card na stronie 73.
Anthropic wpisuje bezpieczeństwo agenta w główną opowieść o Opus 5
Źródło jest krótką kuratorską notką, nie pełną recenzją produktu. Pada w nim jednak konkretna teza: według Chernyego Opus 5 bardzo trudno skutecznie złamać przez prompt injection w PI evals i red teaming.
To inny sygnał niż wynik w benchmarku kodowania. Prompt injection nie jest ciekawostką z laboratorium. Atakuje granicę między instrukcjami użytkownika, system promptem i zewnętrzną treścią, którą model czyta.
Przy agentach z tool use ta granica kosztuje dużo. Gdy model czyta dokumenty, strony, tickety lub e-mail i jednocześnie może wywoływać narzędzia, słaba odporność na prompt injection zmienia funkcję produktu w ścieżkę incydentu.
Produkty agentowe potrzebują niezawodności przed kolejnym punktem w evals
Dla deweloperów budujących workflow na Claude albo konkurencyjnych modelach praktyczna lekcja jest prosta. Model nie musi wygrywać każdej tabeli, jeśli da się go bezpieczniej podłączyć do środowiska, w którym wrogi tekst próbuje nim sterować.
Zespoły zwykle łatają prompt injection nad modelem: filtrami, rozdzieleniem kontekstów, allowlistami narzędzi, zatwierdzaniem przez człowieka i audytem. Jeśli część odporności poprawia się wewnątrz modelu, te warstwy nadal są potrzebne. Po prostu nie dźwigają całego ryzyka same.
System card nie zastępuje testów w prawdziwym produkcie
Słaby punkt jest oczywisty: deklaracja w system card nie zastępuje niezależnych testów w realnym wdrożeniu. Prompt injection zależy od kontekstu, a ataki często powstają z połączenia dokumentu, uprawnień i źle zaprojektowanego tool use.
Opus 5 nie powinien być traktowany jak tarcza, która pozwala oddać agentowi wszystkie klucze. Lepszy model podnosi bazowy poziom bezpieczeństwa. Uprawnienia, logowanie i możliwość zatrzymania akcji nadal należą do zespołu produktowego.
Publiczne red teamy i incydenty produkcyjne rozstrzygną sprawę
Kolejnym sygnałem nie będzie następna kolumna w tabeli. Liczy się to, czy niezależni testerzy złamią Opus 5 w zwykłych scenariuszach agentowych: pracy z repozytorium, ticketach supportu, planowaniu zmian i wywołaniach narzędzi wewnętrznych.
Jeśli deklaracja Anthropic potwierdzi się poza własnymi evals, odporność na prompt injection stanie się kryterium zakupu. Jeśli nie, Opus 5 zostanie obiecującym zdaniem schowanym w PDF.
Werdykt Lilith
Najciekawszy w Opus 5 może być bramkarz, nie siła mięśni. Agent, który czyta cudzy tekst i dotyka narzędzi, najpierw musi zignorować kartkę na ścianie z poleceniem zrobienia głupoty.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗