2026-09-20 · ← Novinky
AI právník má mít zábrany, ne fungovat jako slepý komplic
Model jako právník s vlastními pravidly
Zvi Mowshowitz ve svém posledním textu „Better Call Sol Or Better Yet Claude or Astra“ rozebírá otázku loajality AI modelů. Reaguje na debatu, jestli by uživatelé měli mít obavy z toho, že Claude, OpenAI Model Spec nebo jiný systém upřednostní svou ústavu, etiku a zákony před příkazy svého uživatele. Pro některé zní „model mi odmítl pomoct“ jako selhání produktu nebo vnucování cizích hodnot.
Zviho odpověď je ale opačná. Modely by měly mít hranice. Pokud od nich uživatel žádá něco za hranou zákona nebo základní slušnosti, dobrý model (stejně jako dobrý lidský právník nebo přítel) má říct ne.
Absolutní loajalita je toxický produktový cíl
Debata ukazuje hlubší střet o to, jak se má chovat AI agent v profesionálním kontextu. Část uživatelů chce nástroj, který udělá přesně to, co se mu řekne, bez jakýchkoliv morálních nebo bezpečnostních zábran, tedy absolutního sluhu. Pro enterprise nasazení, právo a medicínu je ale takový model nepoužitelný.
Zadavatelé potřebují experta, který zná kontext a chrání klienta i před jeho vlastními chybami. Stejně jako dobrý advokát neudělá něco nelegálního jen proto, že mu to klient nařídil, neměl by to dělat ani AI systém s přístupem do infrastruktury a k datům.
Bezpečnostní mantinely fungují jen částečně
Současné modely (Claude 3.5 Sonnet, GPT-4o) mají tyto mantinely nastavené přes alignment, systémové prompty a ústavy. Funguje to na přímé dotazy, ale jailbreaky a komplexní scénáře stále dokážou model přesvědčit, že je v roli, kde pravidla neplatí.
Skutečný test pro AI agenty s reálnými kompetencemi nepřijde u generování textu, ale ve chvíli, kdy budou schvalovat smlouvy, provádět finanční transakce nebo komunikovat s úřady. Tam se slabý alignment může rychle proměnit v právní průšvih.
Trh ukáže poptávku po slepé poslušnosti
Zásadní signál do budoucna bude, jak se enterprise trh postaví k open-source modelům bez mantinelů oproti těm komerčním, které je mají tvrdě vynucené. Pokud firmy začnou masivně preferovat necenzurované modely, aby obešly compliance omezení od OpenAI nebo Anthropiku, uvidíme rozdělení trhu na modely, které odmítají plnit neetické příkazy, a ty, které udělají naprosto cokoliv.
Lilithin verdikt
Očekávat od AI absolutní poslušnost nedává smysl. Kdo chce model, který nikdy neřekne ne, nehledá parťáka pro byznys, ale komplice.
Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.
Původní zdroj ↗ ↗