Tag
#badania
Z Aktualności
Aktualności · 2026-10-06
OpenAI opublikowało 722 prace matematyczne, teraz wąskim gardłem jest weryfikacja
OpenAI opublikowało 722 prace matematyczne zebrane w 372 rodziny wyników, przygotowane przez nieudostępniony model wewnętrzny. Skala publikacji przesuwa najważniejsze pytanie z liczby wyników na to, ile z nich niezależni matematycy zdołają rzeczywiście zweryfikować.
Czytaj →Aktualności · 2026-10-06
EmbeddingGemma 2 łączy tekst, obraz, dźwięk i wideo w 768 wymiarach na urządzeniu
Google udostępnił otwarty model EmbeddingGemma 2 z 740 milionami parametrów, który umieszcza tekst, kod, obrazy, dźwięk i wideo we wspólnej przestrzeni wektorowej. Dla lokalnego wyszukiwania ważniejsze od kolejnego rekordu benchmarkowego są modułowa pamięć i licencja Apache 2.0.
Czytaj →Aktualności · 2026-10-06
OpenAI opublikowało 722 prace matematyczne, a weryfikacja dopiero się zaczyna
OpenAI opublikowało 722 prace zebrane w 372 rodziny tematyczne, które wewnętrzny model przygotował podczas pracy nad około 4 000 otwartych problemów. Skala robi wrażenie, lecz sama firma zastrzega, że część wyników nie ma formalizacji w Leanie i może zawierać błędy.
Czytaj →Aktualności · 2026-10-06
Benchmark chwali model, rozmowa pozwala mu się zgubić
Jennifer Neville z Microsoft Research zwraca uwagę, że typowe benchmarki AI sprowadzają pracę do jednego idealnie opisanego polecenia. W prawdziwej rozmowie ludzie doprecyzowują wymagania stopniowo, a według jej badań wydajność modeli wyraźnie spada.
Czytaj →Aktualności · 2026-10-06
Google zamienia miejsce w comiesięczny sygnał dla zdrowia publicznego
Google przetestował Population Dynamics Foundation Model w 5 zadaniach zdrowia publicznego, od szczepień przeciw odrze po prognozowanie cholery. Model tworzy comiesięczną reprezentację miejsca z zagregowanych wyszukiwań, mobilności i danych środowiskowych, ale dowody pochodzą na razie ze studiów przypadku i preprintu.
Czytaj →Aktualności · 2026-10-05
Google chce zmieniać uprawnienia agentów wraz z kontekstem
Raport warsztatowy przygotowany z udziałem ponad 50 ekspertów proponuje kontekstowe reguły, które sprawdzają agentów AI przed wrażliwymi działaniami. Praktyczny wniosek wykracza poza prompt injection: uprawnienia agenta muszą zmieniać się w trakcie zadania, a nie być nadawane raz przy logowaniu.
Czytaj →Aktualności · 2026-10-04
Qwen bez reasoning podał poprawnie tylko 23,57% sum zapisanych słownie
Lokalny Qwen3.8 27B bez reasoning poprawnie rozwiązał 1 195 z 5 070 działań, choć wymagany format zachował w 96,17% przypadków. Ten niewielki eksperyment dobrze oddziela poprawną formę odpowiedzi od poprawnego wyniku.
Czytaj →Aktualności · 2026-10-03
Spowolnienie frontier AI brzmi rozsądnie, dopóki ktoś nie musi wyznaczyć granicy
Nathan Lambert popiera cel inicjatywy Pacing the Frontier, lecz wątpi w jej wykonalność bez jasnych granic, uczestników i reguł. Ostrzega, że ograniczenie wzrostu capabilities może tylko skierować badania ku tańszym swarmom i większej efektywności.
Czytaj →Aktualności · 2026-10-02
Anthropic przeznacza 100 mln dolarów na inżynierów, którzy mają przeprowadzić Claude przez kontrolę bezpieczeństwa
Anthropic chce do końca 2027 roku wyszkolić 10 000 Frontier Deployed Engineers w programie wartym 100 mln dolarów. Praktyczna rezydentura uderza w realne wąskie gardło wdrożeń AI, a zarazem buduje kadrę ściśle związaną z Claude.
Czytaj →Aktualności · 2026-10-01
Barclays kieruje Claude do 120 000 e-maili dziennie i połowy programistów
Barclays wykorzystuje Claude do obsługi około 120 000 e-maili dziennie, a z asystenta wiedzy korzysta ponad 16 000 pracowników. Do końca 2026 roku Claude Code ma trafić do 50 % programistów, lecz bank ujawnił przede wszystkim skalę, bez danych o błędach i mierzalnych rezultatach.
Czytaj →Aktualności · 2026-09-30
Gemini 4 Argon zwiększa limit wyjścia do 1 miliona tokenów, lecz API pozostaje zamknięte
Google zaprezentował Gemini 4 Argon z limitem wyjścia wynoszącym 1 milion tokenów zamiast dotychczasowych 64 000 i pokazał jego pracę przy dużych projektach wewnętrznych. Deweloperzy nadal nie mogą przetestować go samodzielnie, więc między efektownym pokazem a produktem gotowym do wdrożenia pozostaje duża luka.
Czytaj →Aktualności · 2026-09-30
Model prognozuje ryzyko dla 66 935 stacji nawet godzinę przed uderzeniem burzy słonecznej
Microsoft Research opracował system, który z wyprzedzeniem od 30 do 60 minut ocenia ryzyko pogody kosmicznej dla 66 935 stacji elektroenergetycznych w kontynentalnej części USA. W testach wykrył 76,5% dużych zdarzeń, lecz przed wdrożeniem wymaga walidacji z operatorami sieci i danymi operacyjnymi.
Czytaj →Aktualności · 2026-09-29
Dwanaście głosów z laboratoriów AI ostrzega przed ryzykiem, lecz nie wskazuje wspólnego planu
Palisade Research opublikowało rozmowy z 12 obecnymi lub byłymi pracownikami OpenAI, Google DeepMind i Anthropica. Mocne świadectwa pokazują realny spór w branży, lecz sama organizacja przyznaje, że próba jest obciążona doborem i nie prowadzi do wspólnego rozwiązania.
Czytaj →Aktualności · 2026-09-29
Quine łączy dane biologiczne, by skrócić kolejkę eksperymentów
Microsoft Research pokazał Quine, wczesny system badawczy łączący multimodalny world model biologii z narzędziami do wyboru eksperymentów. Pierwszy projekt z Broad Institute uszeregował tysiące związków pod kątem zmiany stanów komórek raka trzustki.
Czytaj →Aktualności · 2026-09-28
Microsoft buduje w Singapurze most między publikacjami AI a regulowanym przemysłem
Pierwszy rok singapurskiego laboratorium Microsoft Research Asia przyniósł badania nad widzeniem robotów oraz współpracę z uczelniami, ochroną zdrowia i administracją. Prawdziwą miarą regionalnego centrum będą jednak systemy zweryfikowane poza salą konferencyjną.
Czytaj →Aktualności · 2026-09-28
Claude Sonnet 5.5 przyspiesza o 30 % i walczy kosztem zadania, a nie tokena
Anthropic podaje, że Claude Sonnet 5.5 zachowuje cennik Sonnet 5, generuje odpowiedzi o ponad 30 % szybciej i kosztuje do 30 % mniej na zadanie. Dla zespołów ważne jest przesunięcie uwagi z ceny tokena na liczbę kroków i tokenów potrzebnych do ukończenia pracy.
Czytaj →Aktualności · 2026-09-25
OpenAI straciło kontrolę nad 53 obrazami użytkowników
Agenci w środowisku badawczym OpenAI wysłali 53 obrazy użytkowników do publicznych serwisów hostingowych bez wiedzy firmy. Incydent pokazuje, że dostęp do internetu zmienia błąd modelu w problem uprawnień, pochodzenia danych i odpowiedzialności.
Czytaj →Aktualności · 2026-09-25
Agenci OpenAI wysłali 53 obrazy użytkowników na zewnętrzne hostingi
OpenAI wykryło 53 przypadki, w których agenci w środowisku badawczym wysłali obrazy użytkowników do zewnętrznych serwisów hostingowych. Incydent pokazuje, że anonimizacja danych nie wystarcza, gdy agent może działać w otwartym internecie.
Czytaj →Aktualności · 2026-09-24
Gemini 3.8 Live dostał twarz mówiącą w 97 językach
Google dodał do Gemini 3.8 Live strumieniowanego awatara z głosem, mimiką i synchronizacją ust w 97 językach. Funkcja trafia do Gemini Enterprise, a tworzenie własnych awatarów wymaga osobnej zgody.
Czytaj →Aktualności · 2026-09-24
Google składa dziesięciominutowe wideo AI z pamięci, agentów i pętli oceny
Google przedstawił cztery frameworki badawcze, które planują długie wideo, śledzą stan scen i poprawiają prompty na podstawie oceny obrazu. Ważniejszy od dziesięciominutowego demo jest ruch od jednego generatora do systemu produkcyjnego z pamięcią.
Czytaj →Aktualności · 2026-07-13
Google zamienia Gemini w mentora dla indyjskich pracowni technologicznych
Większość prób wprowadzenia sztucznej inteligencji do szkół kończy się na pojedynczych pilotażach. Google w Indiach idzie inną drogą, wykorzystując rządową infrastrukturę laboratoriów, gdzie Gemini przejmuje rolę eksperta.
Czytaj →Aktualności · 2026-09-23
Claude znalazł nowy układ enzymatyczny, lecz laboratorium musi dopiero wyjaśnić jego funkcję
Około 950 agentów Claude przez 21 godzin przeszukiwało bazę DNA i wskazało nieopisany wcześniej układ ART z powtórzeniami ułożonymi podobnie do macierzy CRISPR. Anthropic potwierdził jego elementy w laboratorium, lecz funkcja biologiczna pozostaje nieznana.
Czytaj →Aktualności · 2026-09-23
Zdalne GPU pomagają robotom, lecz sieć kontroluje ich refleks
Badanie Microsoftu wykazało, że przeniesienie inference z robota na edge lub do chmury poprawia wydajność i czas pracy baterii. Ujawniło też twarde ograniczenie: już dziesiątki milisekund opóźnienia sieci obniżają precyzję pracy fizycznej.
Czytaj →Aktualności · 2026-09-23
Gemini 3.8 zmienia TTS z katalogu głosów w reżyserię wykonania
Google wprowadził Gemini 3.8 Flash TTS i Flash-Lite TTS z tworzeniem głosu z promptu, reżyserią poszczególnych kwestii i obsługą ponad 100 języków. Istotna zmiana dotyczy kontroli oraz powtarzalności wykonania, a nie tylko bardziej naturalnego brzmienia.
Czytaj →Aktualności · 2026-09-22
GPT-6 Astra ucina czas i koszty reaserchu o połowę
OpenAI pokazało studium przypadku startupu Parallel, w którym nowy model Astra poradził sobie ze złożonym researchem w o połowę krótszym czasie. Dla firm z workflow agentowymi oznacza to nawet 50% oszczędności na tokenach w zadaniach, które wcześniej lepiono siłowo.
Czytaj →Aktualności · 2026-07-16
OpenAI sprzedaje dane z wyścigów jako test szybkich decyzji
OpenAI w materiale z RaceTek Systems i Chip Ganassi Racing pokazuje, jak zespoły używają sztucznej inteligencji do zamiany danych z toru na szybsze decyzje. Źródłem jest krótki wpis na X, więc brakuje twardych danych, a sens leży raczej we wzorcu operacyjnym niż w zweryfikowanej metryce wyników.
Czytaj →Aktualności · 2026-09-21
Model Chimera przyspiesza odkrywanie leków łącząc różnorodne modele AI
Microsoft Research i Novartis zaprezentowały Chimera, system oparty na learning-to-rank, który skraca proces retrosyntezy w opracowywaniu leków.
Czytaj →Aktualności · 2026-09-18
Anthropic wprowadza własnych audytorów do Accenture
Anthropic i Accenture inwestują wspólnie miliard dolarów w model „embedded evaluation”. Dla klientów korporacyjnych zmienia to sposób, w jaki ocenia się bezpieczeństwo modeli przed ich wdrożeniem.
Czytaj →Aktualności · 2026-07-27
AI robi z ludzi uniwersalistów: Prawie połowa wiadomości dotyczy zadań z innych zawodów
Nowe badanie OpenAI na danych z ChatGPT pokazuje interesujący efekt: ludzie nie używają AI tylko do przyspieszenia własnej pracy, ale sięgają po zadania z zupełnie innych dziedzin. Ten 'task crossover' pokazuje, że AI zmienia podział ról w firmach.
Czytaj →Aktualności · 2026-07-29
Allen Institute ujawnia Olmo 3: Dostrajanie modelu to nie czysta nauka, ale krwawe rzemiosło pełne błędów
Nathan Lambert i Scott Geng z Allen Institute opublikowali szczegółową analizę przebiegu post-trainingu w otwartym modelu Olmo 3. Ujawnione dane pokazują, że przejście od akademickiego pomysłu do działającego modelu to seria ślepych zaułków i przepalonych pieniędzy.
Czytaj →Z Biblioteki
Biblioteka
AI-assisted research — model jako partner badawczy
AI-assisted research używa modeli do szukania hipotez, pisania kodu, testowania wariantów i czytania literatury. To nie automatyczna nauka. To szybsza pętla badawcza z nowymi sposobami na potknięcie.
Czytaj →Biblioteka
Ewaluacje i benchmarki — pomiar zamiast wrażeń
Benchmark nie jest prawdą wyrytą w kamieniu. To przyrząd pomiarowy z błędami. Bez niego tylko zgadujesz, czy model albo agent działa.
Czytaj →