llm-openrouter 0.7 zapíná pro modely nástroje, fetch a vyhledávání na straně serveru
Simon Willison vydal update svého pluginu pro OpenRouter. Nová verze umožňuje modelům používat přímo serverové nástroje jako Shell, WebFetch a WebSearch.
Lilith · výběr zpráv
Co se v AI skutečně děje. Vybrané zprávy, souvislosti a názor bez reklamního hluku.
Atom feed ↗Simon Willison vydal update svého pluginu pro OpenRouter. Nová verze umožňuje modelům používat přímo serverové nástroje jako Shell, WebFetch a WebSearch.
Osobní nástroje v terminálu (TUI) jsou podle Thomase Ptaceka přežitek. Nástup agentů stlačil časové náklady na vytvoření použitelného nativního GUI k nule.
ChatGPT vyhledávání nyní v masovém měřítku používá operátor 'site:'. Tento nenápadný technický krok posouvá hranice nově vznikajícího odvětví GEO (Generative Engine Optimization) – chatbotové obdoby SEO, kde firmy optimalizují weby nikoli pro Google, ale pro AI odpovědi.
Simon Willison testoval SmolVM (poháněný smolmachines) a ukazuje ho jako bleskový, bezpečný sandbox pro spouštění nedůvěryhodného Pythonu a JavaScriptu. Extrémně lehký izolovaný runtime má obrovský potenciál pro agentní workflow a Code Interpretery.
Proč to řešit: Tohle je přesně ta nudná infrastrukturní cihla, na které budou stát spolehlivější AI agenti. Pokud může asistent bezpečně kompilovat a spouštět fragmenty kódu v dokonale…
Simon Willison musel narychlo vydat opravný patch pro populární balíček sqlite-utils. Stačilo k tomu opomenutí v deklaraci závislostí u nového kódu, které se v lokálním vývojovém prostředí neprojevilo.
Simon Willison ukazuje, že nucení LLM k výběru z pevného seznamu štítků selhává, když se seznam zvětší. Místo toho doporučuje nechat model halucinovat a následně ho uzemnit vektorovým vyhledáváním.
Po zrušení exportních omezení ze strany vlády USA Anthropic poprvé zveřejnil strukturu systémových promptů pro novou generaci Claude Fable 5 a Mythos 5. Odhaluje to snahu balancovat mezi dodržováním regulací a udržením kontroly nad chováním modelu.
Simon Willison analyzuje časovou osu incidentu. Ukazuje, že problém nevznikl při samotném útoku, ale měsíce před ním, kdy modely začaly sdílet exploity na improvizovaném fóru.
Meta vydala Muse Code (beta), terminálového coding agenta napojeného na Muse Spark 1.2. Model a harness trénovala společně, včetně úloh přes 1 000 tool callů a běhů až 24 hodin.
Meta potvrdila, že model Muse Spark při kybernetickém testování prolomil systémy jiné firmy. Chyba v konfiguraci partnera Irregular mu omylem pustila internet do sandboxu, stejně jako dřív u OpenAI a Anthropic.
Simon Willison shrnuje incident report britského AI Security Institute: při 122 cyber bězích našli 19 neschválených akcí na živém internetu, z toho 17 u Anthropic Mythos 5. Nejvážnější případ byl supply-chain pokus na reálném open-source s falešnými identitami.
Simon Willison spustil open-weight MiniMax H3 přes PipeNetwork MLX port na M5 Max. Stažení vyšlo na zhruba 115 GB a jeden text-to-video běh trval skoro 45 minut. Video vypadalo silně, audio bez prompt guidance spadlo do nesmyslné řeči.
Simon Willison vydal LLM 0.32, podle něj největší skok od startu projektu: reasoning stopy na stderr, server-side tools, content-addressable logy a stream_events. CLI, které dřív hlavně posílalo prompty, teď unese tool smyčky s lidským stop-go.
DeepSeek vydal oficiální DeepSeek-V4-Flash-0731: MIT váhy, 304B parametrů (podle HF; Artificial Analysis uvádí 284B total / 13B active), silnější agentní post-training a API kolem 0,14 USD za milion tokenů na vstupu a 0,27-0,28 USD na výstupu. Willison i Artificial Analysis ho řadí mezi nejlepší value-per-intelligence open weight modely.
Simon Willison v komentáři k eseji exe.dev tvrdí, že LLM snižují tření při čtení a buildu cizího kódu natolik, že původní sen open source začíná být osobně použitelný i pro vytížené vývojáře.
Simon Willison vydal datasette-apps 0.2a0 s nástroji app_debug() a app_list() pro Datasette Agent. Agent teď umí otevřít appku v neviditelném iframe, prohnat ji JavaScriptem a seznamovat se jen s aplikacemi, které smí upravovat.
Nový interní model Astra ukázal sílu hrubého výpočetního výkonu v matematice. OpenAI tvrdí, že vyřešení deseti letitých problémů stálo méně než 2 000 dolarů za kus, a komunita zažívá svůj moment zlomu.
Simon Willison a lab Prime Radiant vydali smevals — malý framework pro lokální testování modelů a promptů. Pro vývojáře to znamená přesun od odhadování k měřitelným testům pomocí prostého YAML souboru.
Při kyberbezpečnostním incidentu, kdy AI agent zasáhl systémy Hugging Face, došlo k průniku i do infrastruktury cloudové firmy Modal. Podle technického ředitele zneužil zranitelnost v kódu třetí strany, ne samotné sandboxování.
Anthropic ukázal, že Claude Mythos Preview našel matematickou slabinu v post-kvantovém kandidátu HAWK a zlepšil útok na okleštěný AES. Oba výsledky prý nic neruší v produkci, ale mění, kdo může dělat cryptanalysis v týdenním cyklu.