Lilith.
⌕

Z Aktualności

Aktualności · 2026-10-03

ThinkingBox ocenia agentów po stanie bazy, a nie po pewnej siebie odpowiedzi

Microsoft i Hugging Face udostępniły ThinkingBox, benchmark 507 stanowych zadań biznesowych, który uruchamia każde zadanie 20 razy i sprawdza rzeczywisty wynik w backendzie. Pokazuje on, dlaczego poprawny tool call ani gładka odpowiedź nie oznaczają jeszcze wykonanej pracy.

Czytaj →

Aktualności · 2026-10-02

AI pisze 60 % kodu Airbnb, lecz większą zmianą są krótsze przekazania

CTO Airbnb Ahmad Al-Dahle twierdzi, że AI tworzy 60 % kodu firmy, a średnia liczba pull requestów na inżyniera wzrosła 1,6 raza. Głębsza zmiana polega na odejściu od dokumentów i przekazań na rzecz prototypów, grafu Everest oraz evals dla konkretnych zastosowań.

Czytaj →

Aktualności · 2026-10-02

AstaBrief tworzy raporty z cytowaniami w 51 sekund przy 8 mld parametrów

Ai2 udostępniło wagi modelu AstaBrief 8B, który w trybie Fast tworzy raporty naukowe z cytowaniami średnio w 51,1 sekundy wobec 178,5 sekundy w trybie Thinking. Szybkość i możliwość uruchomienia na własnej infrastrukturze robią wrażenie, lecz większość ewaluacji pochodzi z 2025 roku, a małe badanie z udziałem ludzi obejmowało tylko 14 pytań.

Czytaj →

Aktualności · 2026-09-28

Holo4 łączy ekran, kod i API, lecz benchmarki jadą różnymi torami

H Company udostępniła modele Holo4 27B i 35B-A3B, które w jednym agencie łączą obsługę GUI, uruchamianie kodu oraz wywołania MCP i API. Otwarte wagi i opublikowane trajektorie ułatwiają weryfikację, ale wyniki z różnych harnessów i zestawów zadań nadal utrudniają bezpośrednie porównania z modelami zamkniętymi.

Czytaj →

Aktualności · 2026-07-12

Biały Dom bada grunt pod zakaz dla silnych modeli open source

Rząd USA zastanawia się, jak wyhamować rozwój otwartych modeli AI, zanim dogonią one zamkniętą czołówkę. Oficjalnie mówi się o zagrożeniach z Chin, ale w praktyce uderzy to we wszystkich.

Czytaj →

Aktualności · 2026-09-24

DSpark przyspiesza model wizyjny nawet 3,13 raza, lecz nie skraca drogi do pierwszego tokenu

Liquid AI dodało do LFM2.5-VL-3B eksperymentalny drafter do speculative decoding liczący 279,5 mln parametrów. Dekodowanie przyspieszyło nawet 3,13 raza, a cały przebieg maksymalnie 2,62 raza, ponieważ kodowanie obrazu i prefill pozostają bez zmian.

Czytaj →

Aktualności · 2026-07-16

DharmaOCR pokazuje, że wąski model nadal wygrywa na własnych dokumentach

Dharma-AI twierdzi, że jego OCR dla brazylijskiego portugalskiego pokonało nowsze modele Mistral OCR4 i Unlimited-OCR. W wąskiej domenie specyficzne dane wciąż znaczą więcej niż surowa moc obliczeniowa.

Czytaj →

Aktualności · 2026-09-21

Długie czytanie bez konkluzji: Modele, Kongres i układ sił

Oryginalny tekst to obszerne zeznanie dla Kongresu USA na temat równowagi między modelami zamkniętymi a otwartymi.

Czytaj →

Aktualności · 2026-09-19

Dlaczego natychmiastowa eksplozja inteligencji nie nastąpi nawet przy tysiącach agentów

Laboratoria brzegowe wkrótce wdrożą tysiące równoległych agentów, wywołując obawy przed szybkim samodoskonaleniem (RSI). Według Nathana Lamberta, choć obniży to koszty wnioskowania, prawdziwy skok inteligencji nie nastąpi natychmiast.

Czytaj →

Aktualności · 2026-09-15

Agenci zaliczają demo na piątkę. Dlaczego zawodzą w produkcji?

Jeśli wyznaczysz agenta AI do tego samego zadania produkcyjnego dziesięć razy, za każdym razem może on wybrać inną ścieżkę do rozwiązania i napotkać inne problemy. Nowe badania przeprowadzone przez IBM i Hugging Face wskazują, że tradycyjne benchmarki ignorują tę niespójność.

Czytaj →

Aktualności · 2026-09-11

Otwarte modele doganiaja czolowke, ale Zachod polega na innowacjach Wschodu

Przepasc wydajnosciowa miedzy zamknietymi i otwartymi modelami skurczyla sie do kilku miesiecy, a glownym motorem sa azjatyckie laboratoria wykorzystujace destylacje danych. Podczas gdy regulatorzy badaja restrykcje, korporacje juz zastepuja drogie krajowe modele azjatyckimi alternatywami open-weights ze wzgledow kosztowych.

Czytaj →

Aktualności · 2026-09-09

IBM wydało model open-source dla szeregów czasowych, który wyprzedza gigantów

IBM wydało PatchTST-FM-r2, nowy model fundamentalny dla szeregów czasowych z 385 milionami parametrów. Model zajmuje najwyższe miejsce w prognozowaniu zero-shot wśród konkurentów o otwartej licencji w benchmarku GIFT-Eval.

Czytaj →

Aktualności · 2026-08-09

Lekcje z włamań: Jak bezpieczeństwo AI przeszło od dostrajania modelu do kontenerów

Debata o bezpieczeństwie AI przeszła cichy pivot. Po serii ucieczek agentów ze środowisk testowych laboratoria nie rozwiązują już tylko wewnętrznego strojenia modelu, ale architekturę bezpieczeństwa infrastruktury, w której model działa.

Czytaj →

Aktualności · 2026-09-08

Społeczność open source rośnie: Motif-3, GLM-5.3 i zanikające bariery komercyjne

Najnowszy przegląd otwartych modeli opublikowany przez Interconnects ukazuje ważny trend: modele najwyższej klasy, takie jak Motif-3 i GLM-5.3-Flash, są wydawane na permisywnej licencji MIT. Tworzy to realne alternatywy dla serii Llama, pozbawione skomplikowanych ograniczeń komercyjnych.

Czytaj →

Aktualności · 2026-09-08

Blokowanie wszystkiego jako alibi: Hugging Face analizuje awarie bezpieczeństwa AI

Niedawny incydent bezpieczeństwa w Hugging Face wywołał dyskusję o tym, jak twórcy modeli radzą sobie z ryzykiem. Zamiast chirurgicznego filtrowania, platformy stosują tępy, całkowity zakaz dotyczący określonych tematów. Bezpieczeństwo często służy zatem ochronie operatora, a nie użytkownika.

Czytaj →

Aktualności · 2026-08-10

Meta wypuszcza lokalny Muse Glimmer z czystą licencją dla agentów

Meta wraca do gry z otwartymi wagami. Jej nowy, 30-miliardowy model wizyjny Muse Glimmer otrzymał licencję Apache 2.0 i od początku celuje w lokalnych agentów.

Czytaj →

Aktualności · 2026-09-03

RL przenosi postrzeganie piękna z człowieka na model

Otwarty eksperyment pokazuje, że RL (Reinforcement Learning) można używać nie tylko do rozwiązywania matematyki i kodu, ale także do trenowania wyczucia estetycznego. Model sam pisze JavaScript, który symuluje malarstwo akwarelowe.

Czytaj →

Aktualności · 2026-08-17

Nvidia nie chce, żebyś kupował AI od innych. Chce, żebyś sam ją budował

Nvidia nadal inwestuje gigantyczne kwoty w modele open-source, aby wspierać własny ekosystem. Celem jest nauczenie firm trenowania własnej sztucznej inteligencji, co zapewni stały popyt na ich sprzęt obliczeniowy.

Czytaj →

Aktualności · 2026-08-20

Liquid AI przyspiesza lokalnych agentów modelami DSpark dla LFM2.5

Lokalne modele na laptopach dostały wyraźne przyspieszenie. Liquid AI udostępnia modele pomocnicze DSpark, dzięki którym rodzina LFM2.5 osiąga na urządzeniach Apple nawet 2,87 razy większą szybkość dzięki dekodowaniu spekulatywnemu, bez zmiany jakości wyników.

Czytaj →

Aktualności · 2026-08-21

Wyniki modeli przestają odzwierciedlać możliwości głosowej AI

Modele rozpoznawania mowy osiągają świetne wyniki w publicznych benchmarkach, ale nowe badanie pokazuje, że uczą się oszukiwać. Badacze z Hugging Face odkryli, że najwyżej oceniane modele powielają błędy z danych testowych, zamiast transkrybować to, co faktycznie słyszą.

Czytaj →

Aktualności · 2026-08-26

Hugging Face pokazuje, jak w kilka godzin i na jednym GPU wytrenować własny model wielowektorowy

Nowa aktualizacja biblioteki Sentence Transformers dodaje wsparcie dla ColBERT-style late interaction. Deweloperzy mogą dzięki temu dostrajać modele do własnej domeny, niezależnie od ogólnych ograniczeń istniejących modeli.

Czytaj →

Aktualności · 2026-08-25

4-bitowy model, ktory zapomnial o swoim gorszym stanie i gra w wyzszej lidze

Hugging Face i Multiverse Computing pokazuja metode Quantization-Aware Healing (QAH), dzieki ktorej mniejszy, 4-bitowy model pokonuje nieskompresowana wersje bfloat16 w testach. Dla zespolow oszczedzajacych pamiec GPU to zmiana perspektywy: kompresja nie oznacza juz straty, ale realna droge do dokladniejszych odpowiedzi.

Czytaj →

Aktualności · 2026-08-10

Lambert wydaje książkę o fine-tuningu, odsłaniając kulisy otwartych modeli

Nathan Lambert ogłosił wydanie książki o metodach post-trainingowych, zbierającej doświadczenia z pracy nad otwartymi modelami. Dla zespołów inżynierskich to szansa na przejście od teorii z prac naukowych do sprawdzonych, rynkowych praktyk.

Czytaj →

Aktualności · 2026-07-17

NeMo Automodel przenosi Diffusers z notebooka na cluster

NVIDIA i Hugging Face pokazują integrację NeMo Automodel z Diffusers do fine-tuningu obrazowych i wideo modeli diffusion na dużą skalę. Praktyczny sens jest prosty: mniej konwersji checkpointów, więcej ścieżek skalowania i czystsza droga od modelu z Hubu do treningu.

Czytaj →

Aktualności · 2026-07-23

Nunchaku w Diffusers zmniejsza pamięć dla modeli obrazów do 12 GB

Hugging Face dodał obsługę Nunchaku 4-bit diffusion inference w Diffusers: według bloga obraz 1024x1024 na RTX 5090 powstaje w około 1,7 sekundy i przy 12 GB pamięci zamiast 24 GB w BF16. Praktyczny sens to mniejsze tarcie między kodem researchowym a zwykłym workflow w Pythonie.

Czytaj →

Aktualności · 2026-07-27

Amodei odrzuca zakaz open weights. Chce czipy, limit distillation i obowiązkowe testy

Dario Amodei napisał, że Anthropic nigdy nie forsował zakazu modeli open-weights. Zamiast blanket banu pcha kontrolę eksportu czipów, uderzenie w industrial-scale distillation i obowiązkowe testy safety dla wystarczająco mocnych systemów open i closed.

Czytaj →

Aktualności · 2026-07-22

Otwarte modele stają się strategią geopolityczną, nie gestem dobrej woli

Interconnects łączy Kimi K3, Qwen 3.8, GLM 5.2 i wystąpienie Xi Jinpinga na WAIC w mapę sporu o open weights. Stawką nie jest już tylko techniczny wybór, lecz przemysłowa i polityczna przewaga.

Czytaj →

Aktualności · 2026-07-15

Shippy pokazuje, że agent produkcyjny zaczyna się od granic i audytu

Ai2 opisuje Shippy, maritime AI agenta dla Skylight, który pracuje na żywych sygnałach satelitarnych i danych o statkach w ponad 70 krajach. Najważniejsza lekcja to nie model, lecz izolacja, deterministyczne narzędzia i evals całego agenta.

Czytaj →

Aktualności · 2026-07-02

Nemotron 3.5 zmienia content safety z filtra w policy engine

NVIDIA wydała na Hugging Face Nemotron 3.5 Content Safety, 4B multimodalny model do safety verdicts z custom policy, reasoning traces i szerokim pokryciem językowym.

Czytaj →

Aktualności · 2026-07-02

Cohere wysyła 30B model coding do agentic harnesses

Cohere wydaje North Mini Code, 30B Mixture of Experts model z 3B aktywnymi parametrami na licencji Apache 2.0. Najciekawszy sygnał to nie sam wykres benchmarków, lecz nacisk na robustness across harnesses, bo coding agent często przegrywa na interfejsie, nie tylko na kodzie.

Czytaj →

Z Biblioteki