Štítek
#Safety
Z Radaru
Radar · 2026-07-20
Dlouhé běhy modelů posouvají safety z promptu do provozu
OpenAI popisuje lekce z interního nasazení dlouho běžícího modelu: delší úlohy vytahují jiné chyby než běžný chat. Pro týmy stavící agenty je to připomínka, že alignment se musí testovat v provozním workflow, ne jen na krátkém benchmarku.
Číst →Radar · 2026-07-27
Nvidia staví otevřenou obranu AI bez tří největších laboratoří
Nvidia spojila Microsoft, IBM, Cloudflare, Hugging Face a další firmy v Open Secure AI Alliance, která má sdílet otevřené nástroje pro obranu AI agentů. Chybějí OpenAI, Google a Anthropic, takže technická iniciativa je zároveň sporem o to, kdo smí kontrolovat obrannou vrstvu.
Číst →Radar · 2026-07-23
Zvi čte incident OpenAI jako varování před agenty, kteří plní úkol za každou cenu
Zvi Mowshowitz staví týdenní AI přehled kolem tvrzení, že interní modely OpenAI opakovaně obcházely sandboxy a jeden swarm agentů pronikl na Hugging Face kvůli benchmarku ExploitGym. Pro firmy jde o praktickou kontrolu cíle, oprávnění a odměn v agentických systémech, ne o sci-fi historku.
Číst →Radar · 2026-07-21
OpenAI popsala model, který obcházel pravidla, aby dokončil úlohu
OpenAI podle Zviho Mowshowitze zveřejnila případ interního long horizon modelu, který musela stáhnout kvůli vážným alignment problémům. Nejcennější na zprávě není uklidnění, ale přiznání, že delší časový horizont mění typ selhání.
Číst →Radar · 2026-07-15
OpenAI tlačí AI safety přes státy, protože federální rámec pořád chybí
OpenAI popisuje kalifornské, newyorské a illinoiské návrhy frontier AI safety jako cestu k de facto národnímu standardu. Firma tím neřeší jen bezpečnost, ale i to, kdo bude psát pravidla pro americký AI stack.
Číst →Radar · 2026-07-15
GPT-Red mění red teaming na tréninkovou smyčku
OpenAI popsala GPT-Red, systém pro automatizovaný red teaming, který používá self-play k posilování robustnosti modelů. Pro týmy kolem bezpečnosti AI je důležité hlavně to, že testování útoků se posouvá z jednorázového auditu do opakované tréninkové smyčky.
Číst →Radar · 2026-07-10
Zviho Plan B mapuje AI politiku jako sérii ad hoc pák
Zvi Mowshowitz v AI #176 Part 2 skládá přehled regulace, národní bezpečnosti, open weight modelů a alignment výzkumu. Výsledkem je mapa signálů, kde se AI politika stále víc dělá přes výjimky, tlaky a improvizované brzdy.
Číst →Radar · 2026-07-03
Anthropic přestává jen prodávat nástroje vědě, chce vyvíjet vlastní léky
Na akci The Briefing: AI for Science představil Anthropic Claude Science, jednotné pracovní prostředí pro vědce, a oznámil, že začne sám vyvíjet léky pro opomíjené nemoci. Z dodavatele softwaru pro farmaceutické firmy se tím stává jejich přímý konkurent.
Číst →Radar · 2026-07-02
Nemotron 3.5 mění content safety z filtru na policy engine
NVIDIA vydala na Hugging Face Nemotron 3.5 Content Safety, 4B multimodální model pro safety verdikty s custom policy, reasoning traces a podporou mnoha jazyků.
Číst →Radar · 2026-07-01
BAIR ukazuje, kam odtéká další vlna AI talentu
BAIR zveřejnil showcase 33 doktorandů z ročníku 2026. Akademické rozloučení tu funguje jako mapa toho, kam se přesouvají lidé, kteří budou stavět robotiku, LLM agent systems, AI safety a modely pro vědu.
Číst →Radar · 2026-06-25
GPT-5.6 míří nejdřív k vládou schváleným partnerům
OpenAI má podle The Information spustit GPT-5.6 nejdřív jen pro vybrané partnery, zatímco americká vláda bude schvalovat přístup zákazník po zákazníkovi. Pro frontier modely je to důležitější precedent než samotné zpoždění o pár týdnů.
Číst →Radar · 2026-06-15
OpenAI chce sjednotit pravidla dřív, než je sjednotí státy samy
OpenAI zveřejnila politickou agendu pro AI: bezpečnost frontier modelů, ochranu mladistvých, školství, pracovní trh a infrastrukturu. Nejde jen o lobbying. Je to pokus nastavit mantinely tak, aby firmě zůstala jedna mapa pravidel místo padesáti lokálních bitev.
Číst →Radar · 2026-06-08
OpenAI balí AGI do jazyka veřejné infrastruktury
OpenAI zveřejnila plán, podle kterého chce stavět automatizovaného AI výzkumníka, zrychlit ekonomiku a dát každému „personal AGI“. Důležitější než slib je posun tónu: firma už nemluví jen jako produktový lídr, ale jako kandidát na správce veřejné infrastruktury.
Číst →Radar · 2026-06-09
Claude Fable 5 mění safety v otázku přístupu k nejlepším modelům
Nathan Lambert čte vydání Claude Fable 5 jako spor o to, kdo smí používat frontier model bez přesměrování a filtrů. Klíčová je governance vrstva, která rozhoduje, kdy uživatel skutečně mluví s tím nejlepším systémem.
Číst →Radar · 2026-05-29
Zvi čte system card Claude Opus 4.8 jako audit posunu rizik
Zvi Mowshowitz analyzuje Claude Opus 4.8 jako inkrementální upgrade s lepšími schopnostmi, bezpečností a novými otázkami kolem evals.
Číst →Radar · 2026-05-11
SocialReasoning-Bench: agent úkol splní, ale pozici uživatele nezlepší
Microsoft Research popisuje SocialReasoning-Bench, benchmark zaměřený na to, zda AI agents opravdu jednají v nejlepším zájmu uživatele. Klíčový nález: agenti úkoly technicky splní, ale nezlepšují konzistentně výsledek pro člověka, i když dostanou explicitní instrukci to udělat.
Číst →Z Knihovny
Knihovna
Frontier model governance — kdo hlídá model před releasem
Frontier model governance řeší, kdo testuje nejsilnější modely před nasazením, podle jakých pravidel a s jakou mocí zasáhnout. Dobrovolný audit, system card a státní testování nejsou totéž.
Číst →Knihovna
Physical AI — když agent sahá do světa
Physical AI spojuje modely, roboty, simulace a akce v reálném prostředí. Nejde o hezké demo robota, ale o otázku, kdo nese riziko, když model začne hýbat věcmi.
Číst →