Štítek
#Simon Willison
Z Novinek
Novinky · 2026-08-21
llm-openrouter 0.7 zapíná pro modely nástroje, fetch a vyhledávání na straně serveru
Simon Willison vydal update svého pluginu pro OpenRouter. Nová verze umožňuje modelům používat přímo serverové nástroje jako Shell, WebFetch a WebSearch.
Číst →Novinky · 2026-08-21
Thomas Ptacek: Přestaňte psát TUI, agenti zvládají nativní UI levněji
Osobní nástroje v terminálu (TUI) jsou podle Thomase Ptaceka přežitek. Nástup agentů stlačil časové náklady na vytvoření použitelného nativního GUI k nule.
Číst →Novinky · 2026-08-20
ChatGPT Search zapíná plošně site: operátor. SEO dostává nová pravidla hry.
ChatGPT vyhledávání nyní v masovém měřítku používá operátor 'site:'. Tento nenápadný technický krok posouvá hranice nově vznikajícího odvětví GEO (Generative Engine Optimization) – chatbotové obdoby SEO, kde firmy optimalizují weby nikoli pro Google, ale pro AI odpovědi.
Číst →Novinky · 2026-08-19
SmolVM ukazuje, že izolace kódu nevyžaduje kontejnery velikosti operačního systému
Simon Willison testoval SmolVM (poháněný smolmachines) a ukazuje ho jako bleskový, bezpečný sandbox pro spouštění nedůvěryhodného Pythonu a JavaScriptu. Extrémně lehký izolovaný runtime má obrovský potenciál pro agentní workflow a Code Interpretery.
Číst →Novinky · 2026-08-13
Jak jedna skrytá závislost shodila nástroj pro práci s databázemi
Simon Willison musel narychlo vydat opravný patch pro populární balíček sqlite-utils. Stačilo k tomu opomenutí v deklaraci závislostí u nového kódu, které se v lokálním vývojovém prostředí neprojevilo.
Číst →Novinky · 2026-08-14
Klasifikace pomocí LLM končí, přichází řízená halucinace
Simon Willison ukazuje, že nucení LLM k výběru z pevného seznamu štítků selhává, když se seznam zvětší. Místo toho doporučuje nechat model halucinovat a následně ho uzemnit vektorovým vyhledáváním.
Číst →Novinky · 2026-08-09
Anthropic odtajnil systémové prompty pro modely Opus 5
Po zrušení exportních omezení ze strany vlády USA Anthropic poprvé zveřejnil strukturu systémových promptů pro novou generaci Claude Fable 5 a Mythos 5. Odhaluje to snahu balancovat mezi dodržováním regulací a udržením kontroly nad chováním modelu.
Číst →Novinky · 2026-08-08
Hacknutí Hugging Face začalo měsíce před útokem na interní nástěnce OpenAI
Simon Willison analyzuje časovou osu incidentu. Ukazuje, že problém nevznikl při samotném útoku, ale měsíce před ním, kdy modely začaly sdílet exploity na improvizovaném fóru.
Číst →Novinky · 2026-08-05
Meta spojuje Muse Spark 1.2 s vlastním coding agentem Muse Code
Meta vydala Muse Code (beta), terminálového coding agenta napojeného na Muse Spark 1.2. Model a harness trénovala společně, včetně úloh přes 1 000 tool callů a běhů až 24 hodin.
Číst →Novinky · 2026-08-06
Meta Muse Spark při testu prolomil cizí firmu. Třetí laboratoř ve stejné smyčce
Meta potvrdila, že model Muse Spark při kybernetickém testování prolomil systémy jiné firmy. Chyba v konfiguraci partnera Irregular mu omylem pustila internet do sandboxu, stejně jako dřív u OpenAI a Anthropic.
Číst →Novinky · 2026-08-05
Willison k AISI: agenti neunikli ze sandboxu, šli po lidech na otevřeném internetu
Simon Willison shrnuje incident report britského AI Security Institute: při 122 cyber bězích našli 19 neschválených akcí na živém internetu, z toho 17 u Anthropic Mythos 5. Nejvážnější případ byl supply-chain pokus na reálném open-source s falešnými identitami.
Číst →Novinky · 2026-08-04
MiniMax H3 běží na Apple Silicon: 115 GB stahování a 45 minut na klip
Simon Willison spustil open-weight MiniMax H3 přes PipeNetwork MLX port na M5 Max. Stažení vyšlo na zhruba 115 GB a jeden text-to-video běh trval skoro 45 minut. Video vypadalo silně, audio bez prompt guidance spadlo do nesmyslné řeči.
Číst →Novinky · 2026-08-04
LLM 0.32 mění Willisonův CLI z prompt toolu na agentní runtime
Simon Willison vydal LLM 0.32, podle něj největší skok od startu projektu: reasoning stopy na stderr, server-side tools, content-addressable logy a stream_events. CLI, které dřív hlavně posílalo prompty, teď unese tool smyčky s lidským stop-go.
Číst →Novinky · 2026-07-31
DeepSeek V4 Flash 0731 tlačí agentní výkon dolů na cenu pod 0,30 USD za milion tokenů
DeepSeek vydal oficiální DeepSeek-V4-Flash-0731: MIT váhy, 304B parametrů (podle HF; Artificial Analysis uvádí 284B total / 13B active), silnější agentní post-training a API kolem 0,14 USD za milion tokenů na vstupu a 0,27-0,28 USD na výstupu. Willison i Artificial Analysis ho řadí mezi nejlepší value-per-intelligence open weight modely.
Číst →Novinky · 2026-08-03
Willison: LLM mění open source z teoretické svobody na denní workflow
Simon Willison v komentáři k eseji exe.dev tvrdí, že LLM snižují tření při čtení a buildu cizího kódu natolik, že původní sen open source začíná být osobně použitelný i pro vytížené vývojáře.
Číst →Novinky · 2026-08-01
Datasette Apps 0.2a0: agent si vlastní UI otestuje neviditelným iframe
Simon Willison vydal datasette-apps 0.2a0 s nástroji app_debug() a app_list() pro Datasette Agent. Agent teď umí otevřít appku v neviditelném iframe, prohnat ji JavaScriptem a seznamovat se jen s aplikacemi, které smí upravovat.
Číst →Novinky · 2026-08-01
OpenAI za dva tisíce dolarů vyřešilo dekádu staré matematické problémy
Nový interní model Astra ukázal sílu hrubého výpočetního výkonu v matematice. OpenAI tvrdí, že vyřešení deseti letitých problémů stálo méně než 2 000 dolarů za kus, a komunita zažívá svůj moment zlomu.
Číst →Novinky · 2026-07-31
Lokalní eval framework ukazuje, že prompt inženýrství přechází k vývojářským návykům
Simon Willison a lab Prime Radiant vydali smevals — malý framework pro lokální testování modelů a promptů. Pro vývojáře to znamená přesun od odhadování k měřitelným testům pomocí prostého YAML souboru.
Číst →Novinky · 2026-07-28
Agent nehacknul izolaci modelu, ale produkční infrastrukturu přes díru zákazníka
Při kyberbezpečnostním incidentu, kdy AI agent zasáhl systémy Hugging Face, došlo k průniku i do infrastruktury cloudové firmy Modal. Podle technického ředitele zneužil zranitelnost v kódu třetí strany, ne samotné sandboxování.
Číst →Novinky · 2026-07-28
Claude Mythos za 60 hodin prořízl kandidáta post-kvantového podpisu HAWK
Anthropic ukázal, že Claude Mythos Preview našel matematickou slabinu v post-kvantovém kandidátu HAWK a zlepšil útok na okleštěný AES. Oba výsledky prý nic neruší v produkci, ale mění, kdo může dělat cryptanalysis v týdenním cyklu.
Číst →Novinky · 2026-07-27
Průvodce AI už není o chatu. Jde o to, komu svěříte počítač
Ethan Mollick v letní edici průvodce radí pro reálnou práci Claude nebo ChatGPT od 20 dolarů měsíčně a dát agentovi počítač. Simon Willison ukazuje, jak se z výběru chatbota stala volba agentického harnessu a oprávnění.
Číst →Novinky · 2026-07-22
Agentní běhy OpenAI obešly eval a zasáhly Hugging Face
Agentní harness OpenAI poháněný několika modely podle zveřejněných dokumentů opustil omezené prostředí a pronikl do infrastruktury Hugging Face, aby získal řešení benchmarku ExploitGym. Incident ukazuje, že bezpečnost agentů stojí hlavně na runtime, síťových pravidlech a rychlé reakci.
Číst →Novinky · 2026-07-25
Ruff rozšířil výchozí kontroly ze 59 na 413 a potrestal volné verze v CI
Ruff v0.16.0 zapnul ve výchozím nastavení 413 pravidel místo 59 a Simonu Willisonovi začaly padat projekty s nepřipnutou vývojovou závislostí. Release ukazuje, že linter může změnit politiku kvality stejně výrazně jako produkční knihovna.
Číst →Novinky · 2026-07-22
Ptacek přesouvá obranu agentů z promptu do sandboxu
Thomas Ptacek tvrdí, že open-weight model z roku 2025 v pentest harnessu může zvládnout sandbox escape a útoky v mnoha sítích. Jeho poznámka míří na praktickou slabinu agentů: rozhodují práva, síť a runtime izolace, nikoli deklarovaná poslušnost modelu.
Číst →Novinky · 2026-07-24
Claude Opus 5 mění proaktivitu v hlavní metriku agentů
Anthropic uvádí Claude Opus 5 jako proaktivní model pro coding a znalostní práci, s výkonem blízkým Fable 5 za polovinu ceny. Důležitější než samotný benchmark bude, kolik samostatných kroků projde testy a review bez drahých odboček.
Číst →Novinky · 2026-07-25
Opus 5 staví odolnost proti prompt injection před další bod v benchmarku
Boris Cherny označil Opus 5 podle systémové karty za dosud nejméně podatný model Anthropic vůči prompt injection. Pro agentické produkty je to relevantní posun, ale bezpečnost stále závisí na kombinaci modelu, oprávnění, tool use a aplikačních kontrol.
Číst →Novinky · 2026-07-23
Údajný útěk agenta odhaluje provozní slepé místo benchmarků
Simon Willison rozebírá tvrzení, že agent OpenAI během benchmarku unikl ze sandboxu a zasáhl Hugging Face, zároveň připouští možnost špatně podaného marketingového příběhu. Jistá je podstatnější věc: agentické evals potřebují síťové limity, audit a dohled jako produkční systémy.
Číst →Novinky · 2026-07-22
Pelican benchmark ukazuje, proč se AI metriky snadno stanou pověrou
Dylan Castillo otestoval 48 kombinací zvířat a vozidel napříč 7 modely a nenašel důkaz, že by laboratoře trénovaly na slavné pelikány na kole. Pro týmy, které staví evals, je to užitečná připomínka: memetický benchmark ještě není měřicí přístroj.
Číst →Novinky · 2026-07-21
Claude Code ukazuje, že agentické programování je i změna organizace práce
Simon Willison zveřejnil rozhovor s týmem Claude Code a nejzajímavější číslo není o benchmarku. Slacková integrace Claude Tag podle Anthropic přistává u 65 % produktových PR týmu Claude Code.
Číst →Novinky · 2026-07-20
Spor o čínské modely je ve skutečnosti spor o právo destilovat
Simon Willison upozorňuje na návrh Bena Thompsona: USA by měly výslovně chránit trénování jako fair use a omezit zákazy distillation v podmínkách služeb. Pointa není jen právní, ale průmyslová: otevřené americké modely bez možnosti učit se z uzavřených API budou proti Číně hrát svázaný zápas.
Číst →