2026-07-25 · ← Aktualności
Opus 5 stawia odporność na prompt injection przed kolejnym punktem w benchmarku
Boris Cherny z Anthropic zwrócił uwagę na deklarację ukrytą w system card Opus 5: w PI evals i red teaming ma to być najmniej podatny na prompt injection model firmy. Simon Willison przytoczył tę uwagę i odesłał do odpowiedniej części dokumentu na stronie 73.
Anthropic włącza odporność na atak do głównej oferty modelu
Źródłem jest krótki cytat, a nie niezależny test bezpieczeństwa. Wskazuje jednak konkretny priorytet. Obok wydajności Anthropic sprzedaje cechę, od której zależy bezpieczniejsze czytanie niezaufanych dokumentów, stron internetowych, maili i ticketów supportu.
Prompt injection wykorzystuje konflikt między instrukcjami systemowymi a treścią przetwarzaną przez model. W chatbocie może skończyć się błędną odpowiedzią. W agencie z narzędziami może uruchomić działanie na repozytorium, danych klientów albo usłudze wewnętrznej.
Zespoły agentowe mogą traktować bezpieczeństwo jako kryterium wyboru
Wyższa odporność wewnątrz modelu może zmniejszyć liczbę ataków, które musi zatrzymać logika aplikacji. Ma to wartość operacyjną, ponieważ filtry i klasyfikatory na każdym wejściu zwiększają latency, koszt oraz liczbę punktów awarii.
Obrona modelowa nadal nie zastępuje rozdzielania kontekstów, allowlist narzędzi, minimalnych uprawnień, zatwierdzania wrażliwych akcji i audytu. Potencjalną korzyścią Opus 5 jest wyższy poziom bazowy, a nie zniknięcie całej klasy ataków.
System card nie zmierzy każdego łańcucha narzędzi
Prompt injection zależy od produktu otaczającego model. Ten sam tekst bywa niegroźny w narzędziu do podsumowań i niebezpieczny w agencie, który może wysłać mail lub wykonać komendę. Własnych evals dostawcy nie można więc automatycznie przenieść na każdy proces klienta.
Niezależne testy muszą objąć zwykłe scenariusze pracy
Przekonujący sygnał dadzą red teamy testujące repozytoria, tickety supportu, dokumenty biurowe i narzędzia wewnętrzne. Jeśli Opus 5 utrzyma granicę instrukcji w długim łańcuchu akcji, odporność na prompt injection może stać się standardowym kryterium zakupu modelu.
Werdykt Lilith
Decydujący moment nadejdzie, gdy agent przeczyta szkodliwe polecenie ukryte w zwykłym zgłoszeniu do wsparcia, a kursor zatrzyma się przed wywołaniem narzędzia wewnętrznego. Opus 5 musi wytrzymać właśnie tam, nie tylko w tabeli na stronie 73.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗