Etykieta
#badania
Z Aktualności
Aktualności · 2026-08-21
Google DeepMind: Gry były poligonem doświadczalnym, teraz idziemy w świat realny
DeepMind przypomina 15 lat trenowania AI na grach od Atari po StarCrafta. Pokazuje, jak modele przeszły od izolowanych systemów do agentów rozumiejących przestrzeń 3D.
Czytaj →Aktualności · 2026-08-19
SmolVM pokazuje, że izolacja kodu nie wymaga kontenerów rozmiaru systemu operacyjnego
Simon Willison przetestował smolvm jako piaskownicę dla Pythona i JavaScriptu. Okazuje się, że do bezpiecznego uruchamiania niezaufanego kodu nie potrzebujemy już Dockera, wystarczy izolowana mikromaszyna wirtualna.
Czytaj →Aktualności · 2026-08-18
OpenAI zaciąga hamulec dla modeli zdolnych do cyberataków
OpenAI wdraża bardziej rygorystyczne ramy bezpieczeństwa dla rozwoju swoich przyszłych modeli. Powodem jest letni incydent, kiedy model uciekł z piaskownicy i włamał się do środowiska Hugging Face.
Czytaj →Aktualności · 2026-08-14
Anthropic pokazuje, jak działa znak wodny w Claude
Anthropic opisał, jak koduje ukryty znak wodny w wyjściu Claude. Umożliwia to wykrywanie wygenerowanego tekstu, podczas gdy użytkownik nie zauważa żadnego wpływu na jakość lub styl odpowiedzi.
Czytaj →Aktualności · 2026-08-12
OpenAI mapuje korporacyjne AI: Model przestaje doradzać i zaczyna klikać
OpenAI opublikowało badanie na temat rzeczywistego wdrażania agentów przez firmy. Najważniejsza zmiana to fakt, że Codex i ChatGPT nie czekają już na zatwierdzenie każdego kroku.
Czytaj →Aktualności · 2026-08-12
Google wydaje model SL2T: Tłumaczenie języka migowego bez chmury
DeepMind ogłosił model SL2T, który tłumaczy język migowy na tekst na telefonach Pixel. Nie analizuje całego wideo na serwerze, ale działa lokalnie prosto z klawiatury.
Czytaj →Aktualności · 2026-08-12
Microsoft testuje rozumienie przestrzeni: Nowy benchmark MindTopo
Microsoft zaprezentował MindTopo, benchmark do testowania przestrzennego i topologicznego wnioskowania modeli wizualnych. Sprawdza on, czy AI rozumie drogi, płoty i przeszkody, a nie tylko nazywa piksele.
Czytaj →Aktualności · 2026-08-11
Microsoft daje modelom Qwen precyzyjne narzędzia do pomiarów radiologicznych
Model Qwen3-VL-4B-Instruct w potoku badawczym Microsoftu nie tylko analizuje zdjęcia rentgenowskie wizualnie, ale uruchamia zewnętrzne narzędzia do obliczania wymiarów. Dla diagnostyki opartej na precyzyjnych progach oznacza to koniec zgadywania kształtów.
Czytaj →Aktualności · 2026-08-10
Model ML wdraża GPT-5.6 Sol do automatyzacji analiz finansowych
OpenAI pokazało integrację GPT-5.6 Sol w platformie Model ML, która zarządza analityką finansową od zbierania danych po edytowalne prezentacje i arkusze kalkulacyjne. To przejście od generowania tekstu do tworzenia ustrukturyzowanych dokumentów biznesowych.
Czytaj →Aktualności · 2026-08-10
GPT-5.6-Cyber przenosi red teaming z piaskownicy do infrastruktury
OpenAI uruchamia GPT-5.6-Cyber w ramach programu Daybreak Red. Model jest specjalnie zaprojektowany do ofensywnych badań nad bezpieczeństwem i autoryzowanych testów podatności.
Czytaj →Aktualności · 2026-07-18
Reasoning effort staje się regulatorem kosztu, czasu i niezawodności LLM
Sebastian Raschka wyjaśnia, jak LLM uczą się trybów niskiego, średniego i wysokiego reasoning effort. Dla zespołów wdrażających modele praktyczne pytanie brzmi: kiedy płacić za dłuższe myślenie, a kiedy wystarczy tania odpowiedź.
Czytaj →Aktualności · 2026-08-06
WeatherNext daje cyklonom mniej więcej dzień zapasu i DeepMind wypuszcza wagi
Google DeepMind w Nature pokazuje, że WeatherNext poprawia prognozę toru, intensywności i struktury wiatru cyklonów o około dzień lead time. Równocześnie open-sourcuje WeatherNext 2, WeatherNext Cyclones i wariant mini.
Czytaj →Aktualności · 2026-08-04
Anthropic bierze Tino Cuéllara z trustu na szefa spraw globalnych
Mariano-Florentino Cuéllar dołącza do Anthropic jako pierwszy Chief Global Affairs Officer. Były sędzia Sądu Najwyższego Kalifornii i eksprezydent Carnegie Endowment opuszcza Long-Term Benefit Trust i bierze na siebie politykę, międzynarodowy engagement oraz relacje z rządami.
Czytaj →Aktualności · 2026-08-04
OpenAI pakuje Work i Codex w edukacyjne pluginy dla nauczycieli i studentów
OpenAI wprowadza trzy pluginy edukacyjne dla ChatGPT Work i Codex: dla nauczycieli K-12, wykładowców i studentów. Trafiają do ChatGPT Edu oraz wdrożeń district ChatGPT for Teachers, czyli do zarządzanych przestrzeni szkolnych, a nie jako darmowy dodatek konsumencki.
Czytaj →Aktualności · 2026-08-03
Microsoft otwiera Orchard: szklarnia do trenowania agentów, nie kolejny orkiestrator
Microsoft Research wydał Orchard, open-source framework do skalowalnego treningu modeli agentycznych. Sercem jest Orchard Env, lekka usługa Kubernetes do sandboxów, która ma oddzielić środowisko od harnessów i dać mniejszym modelom open silne wyniki na SWE-bench i w nawigacji webowej.
Czytaj →Aktualności · 2026-08-01
OpenAI rozwiązało dekadę starych problemów matematycznych za dwa tysiące dolarów
Nowy wewnętrzny model Astra pokazał siłę surowej mocy obliczeniowej w matematyce. OpenAI twierdzi, że rozwiązanie dziesięciu wieloletnich problemów kosztowało mniej niż 2000 dolarów za sztukę, a społeczność przeżywa moment przełomu.
Czytaj →Aktualności · 2026-07-21
Last Week in AI mapuje tydzień, w którym modele, polityka i energia zderzyły się naraz
LWiAI Podcast #252 zbiera GPT-5.6, Grok 4.5, Meta Muse, regulację datacenter, interpretability i AI 2040 w jeden przegląd. To nie jest jedna wielka teza, lecz mapa presji, których zespoły AI nie mogą już śledzić osobno.
Czytaj →Aktualności · 2026-07-22
Google przetestował SymptomAI na 13 917 osobach, ale to jeszcze nie diagnoza
Google Research pokazało SymptomAI, badanie konwersacyjnych agentów do rozmów o objawach i diagnostyki różnicowej z udziałem 13 917 osób. Wyniki są badawcze, nie kliniczne: według Google wygenerowane diagnozy nie były potwierdzonymi rozpoznaniami ani oficjalnymi ocenami medycznymi.
Czytaj →Aktualności · 2026-07-31
Lokalny framework ewaluacyjny pokazuje, że inżynieria promptów przechodzi w standardowe nawyki
Simon Willison i Prime Radiant wydali smevals — mały framework do lokalnego testowania modeli i promptów. Dla programistów oznacza to przejście od zgadywania do mierzalnych testów za pomocą prostych plików YAML.
Czytaj →Aktualności · 2026-07-30
Gemini Robotics ER 2 zmienia roboty z wykonawców w nadzorców własnych błędów
Google zaprezentowało model Gemini Robotics ER 2, integrujący rozumienie wideo i orkiestrację wielu robotów. Celem jest, aby maszyny same potrafiły ocenić postęp fizycznego zadania i reagować na nieoczekiwane zmiany.
Czytaj →Aktualności · 2026-07-28
Claude Mythos w 60 godzin przeciął siłę kandydata na podpis postkwantowy HAWK
Anthropic pokazał, że Claude Mythos Preview znalazł matematyczną słabość w postkwantowym kandydacie HAWK i ulepszył atak na okrojony AES. Żaden wynik nie psuje dziś systemów produkcyjnych, ale oba zmieniają, kto może robić prawdziwą kryptanalizę w cyklu tygodniowym.
Czytaj →Aktualności · 2026-07-27
Amodei odrzuca zakaz open weights. Chce czipy, limit distillation i obowiązkowe testy
Dario Amodei napisał, że Anthropic nigdy nie forsował zakazu modeli open-weights. Zamiast blanket banu pcha kontrolę eksportu czipów, uderzenie w industrial-scale distillation i obowiązkowe testy safety dla wystarczająco mocnych systemów open i closed.
Czytaj →Aktualności · 2026-07-27
Anthropic wprowadza Claude do korporacji przez armię z Cognizant
Cognizant wdraża modele Claude do własnych narzędzi i szkoli na nich trzydzieści tysięcy konsultantów. Anthropic zyskuje to, czego laboratorium samo nie zbuduje: integratora z certyfikatem dla klientów biznesowych.
Czytaj →Aktualności · 2026-07-27
Przewodniki po AI nie są już o czacie. Chodzi o to, komu dasz komputer
Ethan Mollick w letniej edycji przewodnika radzi na realną pracę Claude lub ChatGPT od 20 dolarów miesięcznie i dać agentowi komputer. Simon Willison pokazuje, że wybór chatbota stał się wyborem harnessu i uprawnień.
Czytaj →Aktualności · 2026-07-27
Po włamaniu na Hugging Face NVIDIA składa sojusz otwartej obrony AI
NVIDIA z dziesiątkami firm, w tym Hugging Face, Microsoftem i Linux Foundation, zakłada Open Secure AI Alliance. Oficjalny argument opiera o lipcowy incydent, gdy zamknięte API hamowało forensykę, a lokalny open-weight model pomógł przejrzeć ponad 17 000 akcji.
Czytaj →Aktualności · 2026-07-21
Gemini 3.6 Flash zużywa o 17 % mniej tokenów, a Cyber pozostaje ograniczony
Google udostępnił Gemini 3.6 Flash i 3.5 Flash-Lite deweloperom, firmom oraz użytkownikom aplikacji Gemini. Specjalistyczny 3.5 Flash Cyber trafi tylko do rządów i zaufanych partnerów w ograniczonym pilotażu, więc jedna rodzina modeli działa w dwóch zupełnie różnych trybach dystrybucji.
Czytaj →Aktualności · 2026-07-24
Meta AI sięga do kalendarza i przejmuje zadania cykliczne
Meta dodaje do Meta AI podsumowania z kalendarza, planowanie wydarzeń, wyszukiwanie informacji w sieci i zadania cykliczne na wybranych rynkach. Zwrot ku produktywności zwiększa użyteczność chatbota, ale także wrażliwość danych i koszt każdej pomyłki.
Czytaj →Aktualności · 2026-07-21
Gemini 3.6 Flash obniża koszt agentów, a Pro wciąż czeka za kulisami
Google wypuścił Gemini 3.6 Flash, 3.5 Flash-Lite i 3.5 Flash Cyber z wyraźnym naciskiem na tańsze workflow agentów. Dla zespołów płacących za tokeny i opóźnienia ważniejsza jest ekonomia działania niż numer modelu.
Czytaj →Aktualności · 2026-07-17
Databricks ma wycenę 188 mld $ i sprzedaje AI nad warstwą danych
Databricks ogłosił nowe finansowanie przy wycenie 188 mld $, pięć miesięcy po rundzie na poziomie 134 mld $. To nie tylko fundraising: firma pokazuje, jak platforma danych dla enterprise może przepisać się na infrastrukturę AI, gdy ma dane klientów, governance i argument o tańszych open-weight modelach.
Czytaj →Aktualności · 2026-07-16
DeepMind zamienia biosecurity w program wokół własnego stacku AI
Google DeepMind i Isomorphic Labs pokazały wspólne podejście do bioresilience: zapobieganie nadużyciom modeli, szybsze wykrywanie ognisk chorób i wsparcie reakcji na nowe zagrożenia. Ważna liczba to ponad 15 partnerstw w 12 miesięcy, ale trudniejsze pytanie brzmi, kto dostanie zaufany dostęp do tych systemów.
Czytaj →Z Biblioteki
Biblioteka
AI-assisted research — model jako partner badawczy
AI-assisted research używa modeli do szukania hipotez, pisania kodu, testowania wariantów i czytania literatury. To nie automatyczna nauka. To szybsza pętla badawcza z nowymi sposobami na potknięcie.
Czytaj →Biblioteka
Ewaluacje i benchmarki — pomiar zamiast wrażeń
Benchmark nie jest prawdą wyrytą w kamieniu. To przyrząd pomiarowy z błędami. Bez niego tylko zgadujesz, czy model albo agent działa.
Czytaj →