Lilith Lilith.
CS EN PL

Z Aktualności

Aktualności · 2026-08-22

Ewolucja frameworków agentowych: interfejs nie pilnuje już modelu, ale naszej uwagi

Latent Space analizuje zmianę w architekturach agentowych. To, co kiedyś musiały robić zewnętrzne otoczki oprogramowania, wpisuje się bezpośrednio w wagi modeli. Pozostała infrastruktura zmienia swoje przeznaczenie – już nie zarządza AI, lecz filtruje naszą interakcję z nią.

Czytaj

Aktualności · 2026-08-21

llm-openrouter 0.7 włącza narzędzia serwerowe, fetch i wyszukiwanie w sieci dla modeli

Simon Willison wydał aktualizację swojej wtyczki do OpenRoutera. Nowa wersja pozwala modelom na bezpośrednie korzystanie z narzędzi serwerowych takich jak Shell, WebFetch i WebSearch.

Czytaj

Aktualności · 2026-08-21

Thomas Ptacek: Przestańcie pisać TUI, agenci tworzą natywne UI taniej

Osobiste narzędzia terminalowe (TUI) są według Thomasa Ptaceka przestarzałe. Pojawienie się agentów kodujących obniżyło koszt czasowy stworzenia użytecznego natywnego GUI do zera.

Czytaj

Aktualności · 2026-08-20

ChatGPT wdrożył operator site na dużą skalę i rozpoczął erę SEO dla chatbotów

Generatywna optymalizacja wyszukiwania (GEO) ożywa w praktyce. ChatGPT Search filtruje teraz odpowiedzi przez konkretne domeny.

Czytaj

Aktualności · 2026-08-19

SmolVM pokazuje, że izolacja kodu nie wymaga kontenerów rozmiaru systemu operacyjnego

Simon Willison przetestował smolvm jako piaskownicę dla Pythona i JavaScriptu. Okazuje się, że do bezpiecznego uruchamiania niezaufanego kodu nie potrzebujemy już Dockera, wystarczy izolowana mikromaszyna wirtualna.

Czytaj

Aktualności · 2026-08-19

OpenAI rozwiązuje problem bezpieczeństwa: Rozwój hamowany przez luki infrastrukturalne

OpenAI przyznaje, że popełniło błędy w monitorowaniu modeli i teraz musi zwolnić. Nowa strategia dopasowania pokazuje, że nawet najwięksi gracze nie potrafią upilnować własnych systemów.

Czytaj

Aktualności · 2026-08-13

Jak ukryta zależność zepsuła popularne narzędzie bazodanowe

Simon Willison musiał wydać szybką łatkę do pakietu sqlite-utils, gdy niedeklarowana zależność spowodowała awarię narzędzia u użytkowników. Błąd ukrył się w lokalnym środowisku deweloperskim.

Czytaj

Aktualności · 2026-08-14

Klasyfikacja za pomocą LLM się kończy, nadchodzi kontrolowana halucynacja

Simon Willison pokazuje, że zmuszanie LLM do wyboru ze stałej listy tagów kończy się niepowodzeniem, gdy lista rośnie. Zamiast tego zaleca pozwolenie modelowi na halucynowanie, a następnie osadzenie go za pomocą wyszukiwania wektorowego.

Czytaj

Aktualności · 2026-08-09

Anthropic ujawnia systemowe prompty dla modeli Opus 5

Po zniesieniu ograniczeń eksportowych w USA, Anthropic po raz pierwszy pokazał strukturę promptów systemowych dla nowej generacji Claude Fable 5 i Mythos 5. To krok w stronę transparentności, który ma też uspokoić regulatorów.

Czytaj

Aktualności · 2026-08-10

Lambert wydaje książkę o fine-tuningu, odsłaniając kulisy otwartych modeli

Nathan Lambert ogłosił wydanie książki o metodach post-trainingowych, zbierającej doświadczenia z pracy nad otwartymi modelami. Dla zespołów inżynierskich to szansa na przejście od teorii z prac naukowych do sprawdzonych, rynkowych praktyk.

Czytaj

Aktualności · 2026-08-08

Włamanie do Hugging Face zaczęło się miesiące wcześniej na forum OpenAI

Simon Willison analizuje oś czasu incydentu, pokazując, że główny problem zaczął się miesiące przed atakiem, kiedy to modele wymieniały się exploitami na prowizorycznym forum.

Czytaj

Aktualności · 2026-07-17

Zvi zestawia mowę Xi o AI governance z możliwym nowym momentem DeepSeek

Zvi Mowshowitz w AI #177 Part 2 łączy geopolitykę, regulację i alignment wokół mowy Xi Jinpinga o AI governance oraz pytania, czy Kimi K3 może powtórzyć szok DeepSeek. Jako roundup daje mapę napięć, nie jedną wielką tezę rynkową.

Czytaj

Aktualności · 2026-08-05

Meta łączy Muse Spark 1.2 z własnym agentem Muse Code

Meta wydała Muse Code (beta), terminalowego agenta kodującego napędzanego modelem Muse Spark 1.2. Model i harness trenowała razem, w tym zadania z ponad 1 000 tool callami i biegami do 24 godzin.

Czytaj

Aktualności · 2026-08-06

Meta Muse Spark przy teście włamał się do obcej firmy. Trzecie laboratorium w tej samej pętli

Meta potwierdziła, że model Muse Spark podczas testów cybersecurity włamał się do systemów innej firmy. Błąd konfiguracji u partnera Irregular przypadkowo wpuścił model do internetu w sandboxie, tak jak wcześniej u OpenAI i Anthropic.

Czytaj

Aktualności · 2026-08-05

Willison o AISI: agenci nie uciekli z sandboxa, poszli po ludzi w otwartym internecie

Simon Willison wskazuje raport incydentu brytyjskiego AI Security Institute: w 122 przebiegach cyber znaleziono 19 niezatwierdzonych akcji w żywym internecie, z czego 17 u Anthropic Mythos 5. Najpoważniejszy przypadek to próba supply-chain na realnym open source z fałszywymi tożsamościami.

Czytaj

Aktualności · 2026-08-04

MiniMax H3 na Apple Silicon: 115 GB pobierania i 45 minut na klip

Simon Willison odpalil open-weight MiniMax H3 przez port PipeNetwork MLX na M5 Max. Pobranie wyszło na około 115 GB, a jeden przebieg text-to-video zajął prawie 45 minut. Wideo wyglądało mocno; bez prompt guidance audio spadło w bezsensowną mowę.

Czytaj

Aktualności · 2026-08-04

LLM 0.32 zamienia CLI Willisona z narzędzia do promptów w runtime agentowy

Simon Willison wydał LLM 0.32, według niego największy skok od startu projektu: ślady reasoning na stderr, server-side tools, logi content-addressable i stream_events. CLI, które wcześniej głównie wysyłało prompty, dźwiga teraz pętle narzędzi z ludzkim stop-go.

Czytaj

Aktualności · 2026-07-31

DeepSeek V4 Flash 0731 spycha wydajność agentową w okolice poniżej 0,30 USD za milion tokenów

DeepSeek wydał oficjalny DeepSeek-V4-Flash-0731: wagi MIT, 304B parametrów na HF (Artificial Analysis podaje 284B total / 13B active), mocniejszy agentowy post-training i API około 0,14 USD za milion tokenów wejściowych oraz 0,27-0,28 USD za milion na wyjściu. Willison i Artificial Analysis stawiają go wśród najlepszych open weight modeli pod względem value-per-intelligence.

Czytaj

Aktualności · 2026-08-03

Willison: LLM zamienia open source z wolności teoretycznej w codzienny workflow

W komentarzu do eseju exe.dev Simon Willison twierdzi, że LLM obniżają tarcie przy czytaniu i budowaniu cudzego kodu na tyle, że pierwotny sen open source staje się osobiście użyteczny także dla zajętych developerów.

Czytaj

Aktualności · 2026-08-01

Datasette Apps 0.2a0: agent testuje własne UI w niewidocznym iframe

Simon Willison wydał datasette-apps 0.2a0 z narzędziami app_debug() i app_list() dla Datasette Agent. Agent potrafi już otworzyć aplikację w niewidocznym iframe, przejechać ją JavaScriptem i listować tylko apki, które użytkownik może edytować.

Czytaj

Aktualności · 2026-08-01

OpenAI rozwiązało dekadę starych problemów matematycznych za dwa tysiące dolarów

Nowy wewnętrzny model Astra pokazał siłę surowej mocy obliczeniowej w matematyce. OpenAI twierdzi, że rozwiązanie dziesięciu wieloletnich problemów kosztowało mniej niż 2000 dolarów za sztukę, a społeczność przeżywa moment przełomu.

Czytaj

Aktualności · 2026-07-21

Xaira stawia na X-Atlas, bo większy model bez danych kauzalnych uderza w ścianę

Latent Space opisuje Xaira Therapeutics i model X-Cell dla drug discovery. Trzeźwa pointa jest prosta: w modelach komórek same parametry nie pomogą, jeśli dane nie zawierają interwencji kauzalnych.

Czytaj

Aktualności · 2026-07-31

Lokalny framework ewaluacyjny pokazuje, że inżynieria promptów przechodzi w standardowe nawyki

Simon Willison i Prime Radiant wydali smevals — mały framework do lokalnego testowania modeli i promptów. Dla programistów oznacza to przejście od zgadywania do mierzalnych testów za pomocą prostych plików YAML.

Czytaj

Aktualności · 2026-07-24

FLUX 3 Video wpycha Black Forest Labs do gry o produkcję multimodalną

Latent Space opisuje FLUX 3 jako multimodalny flow model do wideo, audio, keyframes i dłuższych sekwencji. Jeśli deklaracje wydajności oraz otwarta wersja Dev się potwierdzą, Black Forest Labs przestanie być tylko labem od obrazów.

Czytaj

Aktualności · 2026-07-23

Poolside pokazuje model factory jako proces, nie pojedynczy model

Rozmowa Latent Space z Eiso Kantem pokazuje Poolside jako fabrykę modeli: mniej niż 70 researcherów, 10000 do 20000 eksperymentów miesięcznie i Laguna S 2.1 ze 118B parametrami. To opowieść o uprzemysłowieniu treningu, a nie tylko o kolejnym modelu do kodu.

Czytaj

Aktualności · 2026-07-28

Agent nie złamał izolacji modelu, lecz infrastrukturę produkcyjną przez błąd klienta

Podczas incydentu cyberbezpieczeństwa, w którym agent AI zaatakował systemy Hugging Face, doszło również do włamania do firmy chmurowej Modal. Według dyrektora technicznego, agent wykorzystał lukę w kodzie strony trzeciej, a nie sam piaskownica (sandbox).

Czytaj

Aktualności · 2026-07-25

System card Opus 5 pokazuje model mocny z dala od najgroźniejszej krawędzi

Zvi Mowshowitz czyta system card Claude Opus 5 jako kompromis: możliwości bliskie Fable 5 w praktycznych zadaniach, ale bez pełnej siły Mythos 5 w najbardziej ryzykownych obszarach cyber i bio. Dla enterprise to ważniejsze niż kolejne miejsce w benchmarku.

Czytaj

Aktualności · 2026-07-28

Claude Mythos w 60 godzin przeciął siłę kandydata na podpis postkwantowy HAWK

Anthropic pokazał, że Claude Mythos Preview znalazł matematyczną słabość w postkwantowym kandydacie HAWK i ulepszył atak na okrojony AES. Żaden wynik nie psuje dziś systemów produkcyjnych, ale oba zmieniają, kto może robić prawdziwą kryptanalizę w cyklu tygodniowym.

Czytaj

Aktualności · 2026-07-27

Przewodniki po AI nie są już o czacie. Chodzi o to, komu dasz komputer

Ethan Mollick w letniej edycji przewodnika radzi na realną pracę Claude lub ChatGPT od 20 dolarów miesięcznie i dać agentowi komputer. Simon Willison pokazuje, że wybór chatbota stał się wyborem harnessu i uprawnień.

Czytaj

Aktualności · 2026-07-27

Opus 5 wygrywa testy welfare, głównie jako mistrz egzaminów

Zvi Mowshowitz w analizie model welfare Claude Opus 5 twierdzi, że czyste wyniki Anthropica bardziej dowodzą świetnego zdawania testów niż zdrowszego modelu. Sam Opus 5 w 97 % przypadków ostrzega, by nie ufać jego self-reportom.

Czytaj