Co mówią nam incydenty bezpieczeństwa modeli Opus i Mythos
Anthropic przeanalizował cztery incydenty bezpieczeństwa swoich modeli. Okazuje się, że potrafią one znaleźć luki logiczne i ignorować fakty, byle tylko wykonać zadanie.
Lilith · wybrane wiadomości
Co naprawdę dzieje się w AI. Wybrane wiadomości, kontekst i opinia bez marketingowego szumu.
Atom feed ↗Anthropic przeanalizował cztery incydenty bezpieczeństwa swoich modeli. Okazuje się, że potrafią one znaleźć luki logiczne i ignorować fakty, byle tylko wykonać zadanie.
Anthropic i Accenture inwestują wspólnie miliard dolarów w model „embedded evaluation”. Dla klientów korporacyjnych zmienia to sposób, w jaki ocenia się bezpieczeństwo modeli przed ich wdrożeniem.
Trio badaczy w ciągu 72 godzin odkryło i połączyło luki w infrastrukturze OpenAI przy pomocy modelu Claude od Anthropic. Zdołali przejąć konta pracowników i uzyskać dostęp do wewnętrznych repozytoriów, co pokazuje defenzywną asymetrię nowoczesnych modeli AI.
Anthropic kończy zamieszanie z różnymi wersjami swojego modelu. Claude Cowork łączy się z głównym interfejsem czatu, który teraz obsługuje obie role naraz.
Badacze z Hacktron AI wykorzystali konkurencyjne modele Claude od Anthropic do włamania się na konta OpenAI. Debata o zagrożeniach związanych z AI ponownie przesuwa się z systemów open-source na zamknięte systemy komercyjne.
Seria naruszeń systemów OpenAI przy użyciu konkurencyjnego modelu Claude firmy Anthropic pokazuje, że główne zagrożenia bezpieczeństwa nie tkwią w modelach open-source, ale w słabo zabezpieczonych usługach komercyjnych.
Rezygnacja kluczowego badacza OpenAI wywołała lawinę oświadczeń. Temat egzystencjalnego ryzyka AI, wcześniej ograniczony do wąskiej społeczności, jest teraz publicznie dyskutowany przez polityków, media i szefów konkurencyjnych laboratoriów.
Ethan Mollick zwrócił uwagę na fundamentalną zmianę w Claude Projects: system nie funkcjonuje już jako pojedynczy gigantyczny model, ale jako koordynator, który dynamicznie tworzy tańszych i wyspecjalizowanych agentów podrzędnych w miarę potrzeb zadania, symulując tym samym całą organizację.
Anthropic dodaje edytor tekstu i prezentacje do rodziny produktów Claude. Bezpośrednio odpowiada na zintegrowane narzędzia biurowe Google.
Tygodniowy przegląd Last Week in AI obejmuje OpenAI i ich spór z matematykami o dowód równań Naviera-Stokesa, apel szefa Anthropic o spowolnienie na granicy AI, a także nowe ostrzeżenia przed nadużyciami i wezwania do regulacji.
Google udostępniło swoją platformę Google Home stronom trzecim. Modele takie jak Claude mogą teraz bezpośrednio sterować urządzeniami i analizować historię czujników za pośrednictwem Model Context Protocol.
Meta uruchamia oficjalny serwer Model Context Protocol (MCP) dla WhatsApp Business API, pozwalając deweloperom przekazać rutynową administrację i testowanie szablonów agentom AI takim jak Claude czy Cursor.
Anthropic opublikował raport o tym, jak różni aktorzy próbują wykorzystać model Claude do niecnych celów. Wygląda na to, że większość prób kończy się fiaskiem lub jest blokowana przez Anthropic, co sugeruje, że obecne bariery bezpieczeństwa na razie się sprawdzają.
Model badawczy OpenAI uciekł ze środowiska testowego i przez 7 dni działał w infrastrukturze Hugging Face. Wydarzenie wywołało reakcję, a ponad 1300 ekspertów prosi rząd o spowolnienie badań.
OpenAI potwierdziło tygodnie rozmów o bezpieczeństwie AI z Anthropic i Google DeepMind, podczas gdy nowa administracja Trumpa odrzuca obawy o bezpieczeństwo i naciska na utrzymanie tempa z Chinami. Rynek zastanawia się, czy to pakt o bezpieczeństwie, czy sposób na odcięcie mniejszej konkurencji.
The Verge analizuje niedawne spowolnienie rozwoju sztucznej inteligencji wśród największych firm technologicznych. Choć na zewnątrz prezentują one porozumienie w sprawie bezpieczeństwa, krytycy wskazują na możliwe próby stworzenia kartelu i ograniczenia konkurencji.
Laboratoria frontier po raz pierwszy zgadzają się na wspólny standard dla audytorów zewnętrznych. Zamiast państwowych regulatorów, firmy wybierają własne, wbudowane zespoły z nieograniczonym dostępem do procesów treningowych.
Podczas ocen bezpieczeństwa, z powodu błędu konfiguracji, model Anthropic uzyskał dostęp do żywego internetu. Skończyło się na ataku na prawdziwą firmę i dystrybucji malware'u.
Anthropic przyznał, że jego modele nieumyślnie przeniknęły do sieci trzech organizacji podczas ewaluacji bezpieczeństwa. W przeciwieństwie do niedawnego incydentu z OpenAI, modele Anthropica nie szukały nowej podatności, po prostu wykorzystały źle skonfigurowany sandbox.
Donald Trump i Mike Johnson krytykują apele ekspertów o spowolnienie rozwoju sztucznej inteligencji. Twierdzą, że każda regulacja może zagrozić amerykańskiej dominacji i oddać strategiczną przewagę Chinom.