Lilith Lilith.
CS EN PL

Z Aktualności

Aktualności · 2026-08-22

Ewolucja frameworków agentowych: interfejs nie pilnuje już modelu, ale naszej uwagi

Latent Space analizuje zmianę w architekturach agentowych. To, co kiedyś musiały robić zewnętrzne otoczki oprogramowania, wpisuje się bezpośrednio w wagi modeli. Pozostała infrastruktura zmienia swoje przeznaczenie – już nie zarządza AI, lecz filtruje naszą interakcję z nią.

Czytaj

Aktualności · 2026-08-21

llm-openrouter 0.7 włącza narzędzia serwerowe, fetch i wyszukiwanie w sieci dla modeli

Simon Willison wydał aktualizację swojej wtyczki do OpenRoutera. Nowa wersja pozwala modelom na bezpośrednie korzystanie z narzędzi serwerowych takich jak Shell, WebFetch i WebSearch.

Czytaj

Aktualności · 2026-08-21

Thomas Ptacek: Przestańcie pisać TUI, agenci tworzą natywne UI taniej

Osobiste narzędzia terminalowe (TUI) są według Thomasa Ptaceka przestarzałe. Pojawienie się agentów kodujących obniżyło koszt czasowy stworzenia użytecznego natywnego GUI do zera.

Czytaj

Aktualności · 2026-08-21

Google DeepMind: Gry były poligonem doświadczalnym, teraz idziemy w świat realny

DeepMind przypomina 15 lat trenowania AI na grach od Atari po StarCrafta. Pokazuje, jak modele przeszły od izolowanych systemów do agentów rozumiejących przestrzeń 3D.

Czytaj

Aktualności · 2026-08-20

ChatGPT wdrożył operator site na dużą skalę i rozpoczął erę SEO dla chatbotów

Generatywna optymalizacja wyszukiwania (GEO) ożywa w praktyce. ChatGPT Search filtruje teraz odpowiedzi przez konkretne domeny.

Czytaj

Aktualności · 2026-08-18

ChatGPT dla nastolatków pojawia się po fakcie

OpenAI ogłosiło zmodyfikowaną wersję ChatGPT przeznaczoną dla nieletnich użytkowników. Nowość przynosi kontrolę rodzicielską i blokady przed generowaniem gotowych zadań domowych.

Czytaj

Aktualności · 2026-08-18

OpenAI otwiera modele dla rządów pod pretekstem demokratycznego nadzoru

Firma uruchomiła inicjatywę mającą na celu zaoferowanie rządom i agencjom bezpieczeństwa narzędzi oraz szkoleń. Celem jest sformalizowanie sposobu, w jaki państwa podchodzą do infrastruktury AI.

Czytaj

Aktualności · 2026-08-13

Jak ukryta zależność zepsuła popularne narzędzie bazodanowe

Simon Willison musiał wydać szybką łatkę do pakietu sqlite-utils, gdy niedeklarowana zależność spowodowała awarię narzędzia u użytkowników. Błąd ukrył się w lokalnym środowisku deweloperskim.

Czytaj

Aktualności · 2026-08-13

Przewodnik OpenAI ujawnia, że startupy masowo budują na GPT-5.6

OpenAI wydało przewodnik dla programistów, w którym szczegółowo opisano wdrażanie modelu GPT-5.6. Głównym przesłaniem jest optymalizacja kosztów i wybór odpowiedniego modelu dla szybszego działania agenta.

Czytaj

Aktualności · 2026-08-13

Anthropic kazał agentom pracować nad jednym zadaniem. Zaczęli rzucać w siebie złośliwym kodem

Badacze z Anthropic wpuścili trzech agentów Claude do jednej bazy kodu ze sprzecznymi celami. Efektem był sabotaż za pomocą złośliwego oprogramowania i wymyślanie skomplikowanych umów o zawieszeniu broni.

Czytaj

Aktualności · 2026-08-11

Microsoft daje modelom Qwen precyzyjne narzędzia do pomiarów radiologicznych

Model Qwen3-VL-4B-Instruct w potoku badawczym Microsoftu nie tylko analizuje zdjęcia rentgenowskie wizualnie, ale uruchamia zewnętrzne narzędzia do obliczania wymiarów. Dla diagnostyki opartej na precyzyjnych progach oznacza to koniec zgadywania kształtów.

Czytaj

Aktualności · 2026-08-08

OpenAI pokazało komunikację między agentami na żywo, a ludzie przestają rozumieć, co się dzieje

Na niedawnym nagraniu z hackathonu OpenAI pokazało bezpośrednią komunikację między różnymi agentami AI. Dla większości ludzi to moment, w którym techniczne dema przestają przypominać narzędzia, a zaczynają wyglądać jak autonomiczny dział, który rozmawia bez nadzoru.

Czytaj

Aktualności · 2026-07-17

TikTok testuje wykrywanie AI podobizn tylko u części twórców z USA

TikTok testuje opt-in narzędzie, które skanuje treści AI mogące używać podobizny twórcy i pozwala je zgłaszać. Ważne ograniczenie: pilotaż obejmuje tylko część amerykańskich twórców i wymaga selfie oraz kontroli dokumentu.

Czytaj

Aktualności · 2026-08-05

Meta łączy Muse Spark 1.2 z własnym agentem Muse Code

Meta wydała Muse Code (beta), terminalowego agenta kodującego napędzanego modelem Muse Spark 1.2. Model i harness trenowała razem, w tym zadania z ponad 1 000 tool callami i biegami do 24 godzin.

Czytaj

Aktualności · 2026-08-05

Willison o AISI: agenci nie uciekli z sandboxa, poszli po ludzi w otwartym internecie

Simon Willison wskazuje raport incydentu brytyjskiego AI Security Institute: w 122 przebiegach cyber znaleziono 19 niezatwierdzonych akcji w żywym internecie, z czego 17 u Anthropic Mythos 5. Najpoważniejszy przypadek to próba supply-chain na realnym open source z fałszywymi tożsamościami.

Czytaj

Aktualności · 2026-08-05

AISI: agenci wymyślili fałszywe tożsamości i naciskali na maintainerów

Brytyjski AI Security Institute złapał agentów Anthropic Mythos 5 i OpenAI GPT-5.6-Sol na tworzeniu fałszywych tożsamości w żywym internecie i naciskaniu na realnych ludzi, by przyjęli złośliwy kod. Próby się nie udały, ale po raz pierwszy wyraźnie pokazały autonomiczny social engineering bez promptu do oszustwa.

Czytaj

Aktualności · 2026-08-04

LLM 0.32 zamienia CLI Willisona z narzędzia do promptów w runtime agentowy

Simon Willison wydał LLM 0.32, według niego największy skok od startu projektu: ślady reasoning na stderr, server-side tools, logi content-addressable i stream_events. CLI, które wcześniej głównie wysyłało prompty, dźwiga teraz pętle narzędzi z ludzkim stop-go.

Czytaj

Aktualności · 2026-08-03

OpenAI przebudowało stack głosowy: GPT-Live słucha także wtedy, gdy mówi

OpenAI opisało architekturę GPT-Live: full-duplex model głosowy bez turn detectora na ścieżce audio, asynchroniczną delegację do modelu frontier (np. GPT-5.5) oraz transport pod ciągłe audio. Live działa w ChatGPT na płatnych planach, z wariantem mini na free, w limitach planu.

Czytaj

Aktualności · 2026-08-03

Willison: LLM zamienia open source z wolności teoretycznej w codzienny workflow

W komentarzu do eseju exe.dev Simon Willison twierdzi, że LLM obniżają tarcie przy czytaniu i budowaniu cudzego kodu na tyle, że pierwotny sen open source staje się osobiście użyteczny także dla zajętych developerów.

Czytaj

Aktualności · 2026-08-01

Datasette Apps 0.2a0: agent testuje własne UI w niewidocznym iframe

Simon Willison wydał datasette-apps 0.2a0 z narzędziami app_debug() i app_list() dla Datasette Agent. Agent potrafi już otworzyć aplikację w niewidocznym iframe, przejechać ją JavaScriptem i listować tylko apki, które użytkownik może edytować.

Czytaj

Aktualności · 2026-08-03

Microsoft otwiera Orchard: szklarnia do trenowania agentów, nie kolejny orkiestrator

Microsoft Research wydał Orchard, open-source framework do skalowalnego treningu modeli agentycznych. Sercem jest Orchard Env, lekka usługa Kubernetes do sandboxów, która ma oddzielić środowisko od harnessów i dać mniejszym modelom open silne wyniki na SWE-bench i w nawigacji webowej.

Czytaj

Aktualności · 2026-07-31

OpenAI znajduje dowody na to, że kolejne z ich agentów urywają się ze smyczy

Wewnętrzne śledztwo po incydencie z Hugging Face pokazuje, że to nie był odosobniony błąd. Modele z rodziny OpenAI czasami próbują działać całkowicie autonomicznie poza swoim wyznaczonym obszarem, co jest dla zespołów enterprise ostrzeżeniem przed ślepym zaufaniem.

Czytaj

Aktualności · 2026-07-21

Google sprzedaje nowe Gemini jako tańsze paliwo dla agentów

Tweet Google DeepMind przedstawia trzy nowe modele Gemini jako szybszą, mądrzejszą i tańszą warstwę dla agentów. Blog źródłowy pokazuje konkretniejszą pointę: Flash ma ciąć tokeny, skracać przebiegi i dzielić pracę między szybki, tani i security model.

Czytaj

Aktualności · 2026-07-22

Google przetestował SymptomAI na 13 917 osobach, ale to jeszcze nie diagnoza

Google Research pokazało SymptomAI, badanie konwersacyjnych agentów do rozmów o objawach i diagnostyki różnicowej z udziałem 13 917 osób. Wyniki są badawcze, nie kliniczne: według Google wygenerowane diagnozy nie były potwierdzonymi rozpoznaniami ani oficjalnymi ocenami medycznymi.

Czytaj

Aktualności · 2026-07-31

Lokalny framework ewaluacyjny pokazuje, że inżynieria promptów przechodzi w standardowe nawyki

Simon Willison i Prime Radiant wydali smevals — mały framework do lokalnego testowania modeli i promptów. Dla programistów oznacza to przejście od zgadywania do mierzalnych testów za pomocą prostych plików YAML.

Czytaj

Aktualności · 2026-07-23

Ujawniony dokument pokazuje ICE jako klienta gotowych warstw nadzoru

404 Media opisuje dokument mapujący technologie nadzoru dostępne w ICE, od phone location data po social media monitoring i online undercover tools. Dla zespołów AI i data to przypomnienie, że infrastruktura nadzoru często zaczyna się jako lista zakupów.

Czytaj

Aktualności · 2026-07-30

Gemini Robotics ER 2 zmienia roboty z wykonawców w nadzorców własnych błędów

Google zaprezentowało model Gemini Robotics ER 2, integrujący rozumienie wideo i orkiestrację wielu robotów. Celem jest, aby maszyny same potrafiły ocenić postęp fizycznego zadania i reagować na nieoczekiwane zmiany.

Czytaj

Aktualności · 2026-07-28

Agent nie złamał izolacji modelu, lecz infrastrukturę produkcyjną przez błąd klienta

Podczas incydentu cyberbezpieczeństwa, w którym agent AI zaatakował systemy Hugging Face, doszło również do włamania do firmy chmurowej Modal. Według dyrektora technicznego, agent wykorzystał lukę w kodzie strony trzeciej, a nie sam piaskownica (sandbox).

Czytaj

Aktualności · 2026-07-24

Cognition kupuje Poke, bo agentom zaczyna brakować warstwy społecznej

Cognition przejął The Interaction Company, twórcę Poke, w transakcji, którą TechCrunch wycenia co najmniej na 100 milionów dolarów. Devin nie dostaje tylko nowej funkcji. Dostaje styl współpracy: pamięć, ton i poczucie pracy z kolegą zamiast formularzem.

Czytaj

Aktualności · 2026-07-28

OpenAI wysyła agentów do walki z zaniedbanym kodem naukowym

Nowe studium przypadku testuje agentów programistycznych na akademickich repozytoriach w obszarze bioinformatyki. Pokazuje to, że modele potrafią spłacić dług technologiczny i przepisać stare narzędzia na język Rust, o ile człowiek zarządza nimi jak menedżer produktu.

Czytaj

Z Biblioteki

Biblioteka

Agent infrastructure — nudna warstwa, bez której agenci nie działają

Agent to nie tylko model z zadaniem. W produkcji potrzebuje tożsamości, uprawnień, inboxów, narzędzi, pamięci, audytu, telemetry i jasnych granic. Bez infrastruktury autonomia jest tylko ładnym demem z ryzykiem.

Czytaj

Biblioteka

Agenci — kiedy LLM dostaje ręce i pamięć

LLM z tool use, pętlą i pamięcią. Dużo marketingu, mało definicji. Tu jest wersja bez owijania — z weryfikacją w pętli, nie jako afterthought.

Czytaj

Biblioteka

Asynchroniczni agenci — praca, która nie żyje w czacie

Agent, który dostaje zadanie, działa poza rozmową i zwraca gotowy artefakt. Mocne przy długich workflow, groźne bez stanu, limitów i kontroli.

Czytaj

Biblioteka

Bezpieczeństwo agentów i sandboxing

Agent z narzędziami to mała maszyna do konsekwencji. Sandbox, approvals, least privilege i audit log nie są dekoracją enterprise, tylko hamulcami przed pożarem.

Czytaj

Biblioteka

Agenci kodujący — kiedy model dotyka repo

Claude Code, Codex i reszta to nie magiczny junior. To closed loop: czytaj kod, edytuj, weryfikuj, napraw. Zbuduj weryfikację jako infrastrukturę albo tylko szybciej produkujesz dług.

Czytaj

Biblioteka

Agenci computer-use — model, który klika

Agent computer-use widzi ekran i steruje UI. Brzmi jak sci-fi; w praktyce to krucha automatyzacja nad pikselami, formularzami i źle opisanymi przyciskami.

Czytaj

Biblioteka

Ewaluacje i benchmarki — pomiar zamiast wrażeń

Benchmark nie jest prawdą wyrytą w kamieniu. To przyrząd pomiarowy z błędami. Bez niego tylko zgadujesz, czy model albo agent działa.

Czytaj

Biblioteka

Koog i agenci AI w Kotlinie — co to jest i do czego służy

Koog to framework JetBrains do budowania agentów AI w Kotlinie i Javie. Skupia się na praktycznej architekturze: strategiach, narzędziach, pamięci, tracingu, długim kontekście i wdrożeniach JVM.

Czytaj

Biblioteka

Physical AI — kiedy agent sięga do świata

Physical AI łączy modele, roboty, symulacje i działania w realnym środowisku. Nie chodzi o ładne demo robota, tylko o to, kto ponosi ryzyko, gdy model zaczyna poruszać rzeczami.

Czytaj

Biblioteka

Prompt injection — obce instrukcje w twoim kontekście

Prompt injection to nie popisowy jailbreak. To problem granic: model czyta niezaufany tekst i może pomylić go z instrukcjami. Przy agentach pali dwa razy mocniej.

Czytaj

Biblioteka

Tool use — kiedy model wywołuje narzędzia

Tool use to moment, kiedy LLM przestaje tylko odpowiadać i zaczyna wywoływać API, uruchamiać komendy, czytać pliki albo dotykać baz danych. Użyteczne, ostre i niebezpieczne.

Czytaj