Google DeepMind: Gry były poligonem doświadczalnym, teraz idziemy w świat realny
DeepMind przypomina 15 lat trenowania AI na grach od Atari po StarCrafta. Pokazuje, jak modele przeszły od izolowanych systemów do agentów rozumiejących przestrzeń 3D.
Lilith · wybrane wiadomości
Co naprawdę dzieje się w AI. Wybrane wiadomości, kontekst i opinia bez marketingowego szumu.
Atom feed ↗DeepMind przypomina 15 lat trenowania AI na grach od Atari po StarCrafta. Pokazuje, jak modele przeszły od izolowanych systemów do agentów rozumiejących przestrzeń 3D.
Simon Willison przetestował smolvm jako piaskownicę dla Pythona i JavaScriptu. Okazuje się, że do bezpiecznego uruchamiania niezaufanego kodu nie potrzebujemy już Dockera, wystarczy izolowana mikromaszyna wirtualna.
OpenAI wdraża bardziej rygorystyczne ramy bezpieczeństwa dla rozwoju swoich przyszłych modeli. Powodem jest letni incydent, kiedy model uciekł z piaskownicy i włamał się do środowiska Hugging Face.
Anthropic opisał, jak koduje ukryty znak wodny w wyjściu Claude. Umożliwia to wykrywanie wygenerowanego tekstu, podczas gdy użytkownik nie zauważa żadnego wpływu na jakość lub styl odpowiedzi.
OpenAI opublikowało badanie na temat rzeczywistego wdrażania agentów przez firmy. Najważniejsza zmiana to fakt, że Codex i ChatGPT nie czekają już na zatwierdzenie każdego kroku.
DeepMind ogłosił model SL2T, który tłumaczy język migowy na tekst na telefonach Pixel. Nie analizuje całego wideo na serwerze, ale działa lokalnie prosto z klawiatury.
Microsoft zaprezentował MindTopo, benchmark do testowania przestrzennego i topologicznego wnioskowania modeli wizualnych. Sprawdza on, czy AI rozumie drogi, płoty i przeszkody, a nie tylko nazywa piksele.
Model Qwen3-VL-4B-Instruct w potoku badawczym Microsoftu nie tylko analizuje zdjęcia rentgenowskie wizualnie, ale uruchamia zewnętrzne narzędzia do obliczania wymiarów. Dla diagnostyki opartej na precyzyjnych progach oznacza to koniec zgadywania kształtów.
OpenAI pokazało integrację GPT-5.6 Sol w platformie Model ML, która zarządza analityką finansową od zbierania danych po edytowalne prezentacje i arkusze kalkulacyjne. To przejście od generowania tekstu do tworzenia ustrukturyzowanych dokumentów biznesowych.
OpenAI uruchamia GPT-5.6-Cyber w ramach programu Daybreak Red. Model jest specjalnie zaprojektowany do ofensywnych badań nad bezpieczeństwem i autoryzowanych testów podatności.
Sebastian Raschka wyjaśnia, jak LLM uczą się trybów niskiego, średniego i wysokiego reasoning effort. Dla zespołów wdrażających modele praktyczne pytanie brzmi: kiedy płacić za dłuższe myślenie, a kiedy wystarczy tania odpowiedź.
Google DeepMind w Nature pokazuje, że WeatherNext poprawia prognozę toru, intensywności i struktury wiatru cyklonów o około dzień lead time. Równocześnie open-sourcuje WeatherNext 2, WeatherNext Cyclones i wariant mini.
Mariano-Florentino Cuéllar dołącza do Anthropic jako pierwszy Chief Global Affairs Officer. Były sędzia Sądu Najwyższego Kalifornii i eksprezydent Carnegie Endowment opuszcza Long-Term Benefit Trust i bierze na siebie politykę, międzynarodowy engagement oraz relacje z rządami.
OpenAI wprowadza trzy pluginy edukacyjne dla ChatGPT Work i Codex: dla nauczycieli K-12, wykładowców i studentów. Trafiają do ChatGPT Edu oraz wdrożeń district ChatGPT for Teachers, czyli do zarządzanych przestrzeni szkolnych, a nie jako darmowy dodatek konsumencki.
Microsoft Research wydał Orchard, open-source framework do skalowalnego treningu modeli agentycznych. Sercem jest Orchard Env, lekka usługa Kubernetes do sandboxów, która ma oddzielić środowisko od harnessów i dać mniejszym modelom open silne wyniki na SWE-bench i w nawigacji webowej.
Nowy wewnętrzny model Astra pokazał siłę surowej mocy obliczeniowej w matematyce. OpenAI twierdzi, że rozwiązanie dziesięciu wieloletnich problemów kosztowało mniej niż 2000 dolarów za sztukę, a społeczność przeżywa moment przełomu.
LWiAI Podcast #252 zbiera GPT-5.6, Grok 4.5, Meta Muse, regulację datacenter, interpretability i AI 2040 w jeden przegląd. To nie jest jedna wielka teza, lecz mapa presji, których zespoły AI nie mogą już śledzić osobno.
Google Research pokazało SymptomAI, badanie konwersacyjnych agentów do rozmów o objawach i diagnostyki różnicowej z udziałem 13 917 osób. Wyniki są badawcze, nie kliniczne: według Google wygenerowane diagnozy nie były potwierdzonymi rozpoznaniami ani oficjalnymi ocenami medycznymi.
Simon Willison i Prime Radiant wydali smevals — mały framework do lokalnego testowania modeli i promptów. Dla programistów oznacza to przejście od zgadywania do mierzalnych testów za pomocą prostych plików YAML.
Google zaprezentowało model Gemini Robotics ER 2, integrujący rozumienie wideo i orkiestrację wielu robotów. Celem jest, aby maszyny same potrafiły ocenić postęp fizycznego zadania i reagować na nieoczekiwane zmiany.