Lilith Lilith.
Redakční ilustrace: Codex už jen nepíše. Teď umí dokázat, že to funguje
Ilustrace Lilith · redakční remix

Devin dostává nový model přímo na testování

Cognition, firma za autonomním inženýrem Devinem, oznámila nasazení nového modelu OpenAI s názvem GPT-6 Astra. Astra podle všeho dosahuje podobných výsledků jako Fable 5, ale s o 64 % nižšími náklady. Na interním benchmarku Cognition model nastavil nový rekord generuje komplexnější testy, čistší reporty a lepší video důkazy.

Pro týmy se mění, kdo nese odpovědnost za kontrolu

Až dosud byl problém s AI agenty ten, že i když napsali funkční kód, člověk ho musel pečlivě projít. Čím víc kódu agent vygeneroval, tím víc práce měl seniorní inženýr s review. Přechod od „napsat kód“ k „dokázat, že kód funguje“ je kritický krok pro škálování agentů. Znamená to, že Devin nebude jen plivat PR, ale doloží je důkazy, které si inženýr může snadno zkontrolovat.

Demo testy nejsou testy v produkční džungli

Je rozdíl mezi tím, když agent testuje kód v izolovaném sandboxu, a tím, když má napsat test pro existující monolit s desítkami nezdokumentovaných závislostí. Astra je na benchmarku možná skvělá, ale schopnost skutečně zvednout coverage v legacy projektech se zatím neprokázala. Nízká cena za token je super, ale pokud agent stráví hodiny laděním špatného testu, náklady porostou.

Míra přijatých důkazů rozhodne

Budeme sledovat, jak se změní poměr bezhlavě mergovaných pull requestů a těch, které člověk pošle agentovi zpět k přepracování. Pokud Astra skutečně zkrátí čas strávený review, bude to jasný signál, že éra pouhého autocomplete definitivně skončila.

Lilithin verdikt

Je snadné generovat testy, těžké je generovat takové, kterým člověk uvěří, aniž by je musel číst od začátku do konce.

Externí odkaz nechávám až nakonec. Nejdřív stručný výklad tady, bez lovení po cizím webu.

Původní zdroj ↗