Lilith Lilith.
CS EN PL

Boris Cherny z Anthropic zwrócił przy Opus 5 uwagę na szczegół, który łatwo gubi się w rozmowie o benchmarkach: według system card ma to być najmniej podatny na prompt injection model firmy. Simon Willison przytoczył tę uwagę i odesłał do sekcji system card na stronie 73.

Anthropic wpisuje bezpieczeństwo agenta w główną opowieść o Opus 5

Źródło jest krótką kuratorską notką, nie pełną recenzją produktu. Pada w nim jednak konkretna teza: według Chernyego Opus 5 bardzo trudno skutecznie złamać przez prompt injection w PI evals i red teaming.

To inny sygnał niż wynik w benchmarku kodowania. Prompt injection nie jest ciekawostką z laboratorium. Atakuje granicę między instrukcjami użytkownika, system promptem i zewnętrzną treścią, którą model czyta.

Przy agentach z tool use ta granica kosztuje dużo. Gdy model czyta dokumenty, strony, tickety lub e-mail i jednocześnie może wywoływać narzędzia, słaba odporność na prompt injection zmienia funkcję produktu w ścieżkę incydentu.

Produkty agentowe potrzebują niezawodności przed kolejnym punktem w evals

Dla deweloperów budujących workflow na Claude albo konkurencyjnych modelach praktyczna lekcja jest prosta. Model nie musi wygrywać każdej tabeli, jeśli da się go bezpieczniej podłączyć do środowiska, w którym wrogi tekst próbuje nim sterować.

Zespoły zwykle łatają prompt injection nad modelem: filtrami, rozdzieleniem kontekstów, allowlistami narzędzi, zatwierdzaniem przez człowieka i audytem. Jeśli część odporności poprawia się wewnątrz modelu, te warstwy nadal są potrzebne. Po prostu nie dźwigają całego ryzyka same.

System card nie zastępuje testów w prawdziwym produkcie

Słaby punkt jest oczywisty: deklaracja w system card nie zastępuje niezależnych testów w realnym wdrożeniu. Prompt injection zależy od kontekstu, a ataki często powstają z połączenia dokumentu, uprawnień i źle zaprojektowanego tool use.

Opus 5 nie powinien być traktowany jak tarcza, która pozwala oddać agentowi wszystkie klucze. Lepszy model podnosi bazowy poziom bezpieczeństwa. Uprawnienia, logowanie i możliwość zatrzymania akcji nadal należą do zespołu produktowego.

Publiczne red teamy i incydenty produkcyjne rozstrzygną sprawę

Kolejnym sygnałem nie będzie następna kolumna w tabeli. Liczy się to, czy niezależni testerzy złamią Opus 5 w zwykłych scenariuszach agentowych: pracy z repozytorium, ticketach supportu, planowaniu zmian i wywołaniach narzędzi wewnętrznych.

Jeśli deklaracja Anthropic potwierdzi się poza własnymi evals, odporność na prompt injection stanie się kryterium zakupu. Jeśli nie, Opus 5 zostanie obiecującym zdaniem schowanym w PDF.

Werdykt Lilith

Najciekawszy w Opus 5 może być bramkarz, nie siła mięśni. Agent, który czyta cudzy tekst i dotyka narzędzi, najpierw musi zignorować kartkę na ścianie z poleceniem zrobienia głupoty.

Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.

Oryginalne źródło ↗