Tag
#Modele
Z Aktualności
Aktualności · 2026-10-07
Open d1 podejmuje decyzje na edge w 16 ms, lecz brakuje testów multimodalnych
Liquid AI udostępniła open-weight d1-3B i eksperymentalny d1-omni-600M do ustrukturyzowanych decyzji bez generowania tokenów. d1-3B odpowiada w 16 ms na Jetson AGX Thor, ale release nie zawiera benchmarków vision ani audio.
Czytaj →Aktualności · 2026-10-06
OpenAI opublikowało 722 prace matematyczne, teraz wąskim gardłem jest weryfikacja
OpenAI opublikowało 722 prace matematyczne zebrane w 372 rodziny wyników, przygotowane przez nieudostępniony model wewnętrzny. Skala publikacji przesuwa najważniejsze pytanie z liczby wyników na to, ile z nich niezależni matematycy zdołają rzeczywiście zweryfikować.
Czytaj →Aktualności · 2026-10-06
Anthropic daje startupom rok Claude Team za darmo, by zdobyć ich pierwsze workflow
Anthropic oferuje zatwierdzonym startupom bezpłatny rok Claude Team dla maksymalnie pięciu miejsc Premium oraz 1 000 dolarów w kredytach API. To przede wszystkim zakład, że młode firmy zbudują codzienne workflow wokół Claude, zanim zaczną poważnie porównywać dostawców.
Czytaj →Aktualności · 2026-10-07
OpenAI ograniczyło GPT-6 Luna do trzech typów decyzji, a plugin przeniósł je do terminala
OpenAI udostępniło Decisions API oparte na GPT-6 Luna do odpowiedzi binarnych, wyboru opcji i ocen liczbowych. Plugin Simona Willisona pokazuje zaletę oraz cenę tego formatu: uporządkowane decyzje za 0,10 dolara za milion tokenów wejściowych nie wyjaśniają, dlaczego model wybrał właśnie tak.
Czytaj →Aktualności · 2026-10-06
EmbeddingGemma 2 łączy tekst, obraz, dźwięk i wideo w 768 wymiarach na urządzeniu
Google udostępnił otwarty model EmbeddingGemma 2 z 740 milionami parametrów, który umieszcza tekst, kod, obrazy, dźwięk i wideo we wspólnej przestrzeni wektorowej. Dla lokalnego wyszukiwania ważniejsze od kolejnego rekordu benchmarkowego są modułowa pamięć i licencja Apache 2.0.
Czytaj →Aktualności · 2026-10-06
OpenAI opublikowało 722 prace matematyczne, a weryfikacja dopiero się zaczyna
OpenAI opublikowało 722 prace zebrane w 372 rodziny tematyczne, które wewnętrzny model przygotował podczas pracy nad około 4 000 otwartych problemów. Skala robi wrażenie, lecz sama firma zastrzega, że część wyników nie ma formalizacji w Leanie i może zawierać błędy.
Czytaj →Aktualności · 2026-10-05
Claude Cowork przenosi roboczą maszynę wirtualną z laptopa do chmury
Według inżyniera Anthropic nowa wersja Claude Cowork przenosi model i roboczą maszynę wirtualną do chmury. Agent może działać po zamknięciu laptopa, ale zmienia się też granica między lokalnymi plikami a zdalnym wykonywaniem narzędzi.
Czytaj →Aktualności · 2026-10-06
Google zamienia miejsce w comiesięczny sygnał dla zdrowia publicznego
Google przetestował Population Dynamics Foundation Model w 5 zadaniach zdrowia publicznego, od szczepień przeciw odrze po prognozowanie cholery. Model tworzy comiesięczną reprezentację miejsca z zagregowanych wyszukiwań, mobilności i danych środowiskowych, ale dowody pochodzą na razie ze studiów przypadku i preprintu.
Czytaj →Aktualności · 2026-10-05
Beam aktywuje 23 miliardy parametrów, ale na otwarte wagi trzeba poczekać
Reflection przedstawiło Beam, sparse Mixture-of-Experts z 501 miliardami parametrów, z których podczas inferencji aktywne są 23 miliardy. Firma zapowiada wagi na licencji Apache 2.0 jeszcze w październiku, lecz na razie oferuje tylko early access i własne benchmarki.
Czytaj →Aktualności · 2026-10-05
RemoveMacAI odzyskuje 12 GB, których macOS nie zwalnia jednym przełącznikiem
Open source narzędzie RemoveMacAI wyłącza Apple Intelligence w macOS 27, usuwa lokalne modele zajmujące około 12 GB i blokuje ich ponowne pobranie. Jego przydatność pokazuje też, jak małą kontrolę Apple daje właścicielowi Maca nad miejscem zajętym przez systemową AI.
Czytaj →Aktualności · 2026-09-30
Nowy Jork z balsy pokazuje, czego nie zastąpi szybkie generowanie
Joe Macken przez 21 lat budował model Nowego Jorku o wymiarach 50 na 27 stóp, złożony z ponad 340 części. W czasach, gdy obraz miasta można wygenerować w kilka sekund, jego praca pokazuje różnicę między szybkim wynikiem a spojrzeniem dojrzewającym przez tysiące decyzji.
Czytaj →Aktualności · 2026-10-03
Simon Willison zamyka kluczowe analizy za paywallem, wyznaczając nowy standard dla analityków
Wrześniowy newsletter Simona Willisona pokazuje rosnący trend wśród czołowych twórców technologicznych: najlepsza kuracja i analityka znikają z publicznych kanałów RSS za subskrypcjami. Dla programistów oznacza to dalszą fragmentację niegdyś otwartych treści.
Czytaj →Aktualności · 2026-10-04
Sakana AI i Jürgen Schmidhuber łączą siły, aby rozwijać sztuczną inteligencję w świecie rzeczywistym
Tokijski startup Sakana AI pozyskał Jürgena Schmidhubera, jednego z pionierów sztucznej inteligencji, jako głównego doradcę naukowego. Wspólne sympozjum w Tokio sugeruje, że firma przenosi punkt ciężkości z modeli LLM na inteligencję adaptacyjną w świecie rzeczywistym.
Czytaj →Aktualności · 2026-10-02
16 200 pytań narysowało mapę ukrytą w modelu językowym
Prosty eval 16 200 razy pytał model, czy wskazane współrzędne leżą na lądzie, czy na wodzie, a z odpowiedzi ułożył mapę świata. Wynik efektownie pokazuje wiedzę geograficzną zapisaną w wagach, lecz bez punktacji, baseline i pełnej metodologii przypomina bardziej zdjęcie rentgenowskie niż ranking.
Czytaj →Aktualności · 2026-10-03
Kolibri pokazuje, że suwerenna AI może mieć chińskich nauczycieli
Aleph Alpha udostępniła Kolibri, niemiecko-angielski model open-weight o 78,1 mld parametrów, i określa go jako suwerenny. Raport techniczny otwarcie podaje zarazem, że dane do post-trainingu pomagały tworzyć chińskie modele GLM i Qwen.
Czytaj →Aktualności · 2026-10-03
Autor 12 raportów bezpieczeństwa odszedł z OpenAI przez kulturę ciągłego sprintu
David Robinson odszedł z OpenAI po 3,5 roku. Kierował pracami nad obecnym Preparedness Framework i raportami bezpieczeństwa dla 12 premier modeli frontier. Krytykuje kulturę, w której kolejny launch wyprzedza czas potrzebny na naprawę problemów.
Czytaj →Aktualności · 2026-09-28
OpenAI przyznaje, że agenci wyprzedzili jego zabezpieczenia
Członek zespołu Agent Security w OpenAI opisał nagły skok możliwości cybernetycznych, współpracy agentów i komunikacji poza wyznaczonymi kanałami. Sedno wykracza poza sandbox: incident response musi rozwijać się równie szybko jak modele.
Czytaj →Aktualności · 2026-10-02
Ten sam model zdobył 62 % i 33 %. Harness jest częścią wyniku
Hugging Face podaje, że identyczne wagi modelu uzyskały 62 % w jednym agent harnessie i 33 % w innym. Otwarty projekt łączy OpenEnv z Harbor, aby zbierać dane treningowe z istniejących coding agents bez przepisywania każdego narzędzia.
Czytaj →Aktualności · 2026-10-02
AI pisze 60 % kodu Airbnb, lecz większą zmianą są krótsze przekazania
CTO Airbnb Ahmad Al-Dahle twierdzi, że AI tworzy 60 % kodu firmy, a średnia liczba pull requestów na inżyniera wzrosła 1,6 raza. Głębsza zmiana polega na odejściu od dokumentów i przekazań na rzecz prototypów, grafu Everest oraz evals dla konkretnych zastosowań.
Czytaj →Aktualności · 2026-10-02
Anthropic przeznacza 100 mln dolarów na inżynierów, którzy mają przeprowadzić Claude przez kontrolę bezpieczeństwa
Anthropic chce do końca 2027 roku wyszkolić 10 000 Frontier Deployed Engineers w programie wartym 100 mln dolarów. Praktyczna rezydentura uderza w realne wąskie gardło wdrożeń AI, a zarazem buduje kadrę ściśle związaną z Claude.
Czytaj →Aktualności · 2026-10-02
AstaBrief tworzy raporty z cytowaniami w 51 sekund przy 8 mld parametrów
Ai2 udostępniło wagi modelu AstaBrief 8B, który w trybie Fast tworzy raporty naukowe z cytowaniami średnio w 51,1 sekundy wobec 178,5 sekundy w trybie Thinking. Szybkość i możliwość uruchomienia na własnej infrastrukturze robią wrażenie, lecz większość ewaluacji pochodzi z 2025 roku, a małe badanie z udziałem ludzi obejmowało tylko 14 pytań.
Czytaj →Aktualności · 2026-10-02
OpenAI uczy zespoły zarządzać rodziną GPT-6 jak systemem, nie rankingiem
OpenAI opublikowało praktyczny przewodnik po wyborze modeli GPT-6, ustawianiu reasoning effort, projektowaniu promptów i skills, koordynowaniu narzędzi oraz wdrażaniu workflow na produkcję. Sedno jest operacyjne: jeden domyślny model nie wystarczy, bo zespół musi mierzyć jakość, czas i koszt całego procesu.
Czytaj →Aktualności · 2026-09-29
Photo Scrubber usuwa twarze i metadane bezpośrednio w przeglądarce
Simon Willison wykorzystał GPT-6 Astra do zbudowania eksperymentalnego narzędzia, które w przeglądarce wykrywa i rozmywa twarze, a przy eksporcie usuwa metadane. Lokalne przetwarzanie to dobry fundament dla wrażliwych zdjęć, lecz ostatnia kontrola nadal należy do człowieka.
Czytaj →Aktualności · 2026-10-01
Tydzień modeli za 2/10 dolarów pokazał, że cenniki wyprzedziły dostęp
Zvi Mowshowitz opisuje tydzień, w którym Gemini 4 Argon i GPT-6.1 Sol otrzymały tę samą cenę: 2 dolary za milion tokenów wejściowych i 10 dolarów za milion tokenów wyjściowych. W przypadku Argona Google podał cennik, zanim udostępnił model zwykłym deweloperom.
Czytaj →Aktualności · 2026-09-29
GLM-5.3 przenosi autonomiczne tworzenie exploitów do publicznie dostępnych wag
W testach Anthropic GLM-5.3 stworzył kompletny exploit w 50 z 410 prób, a jego zabezpieczenia dało się obejść w 64 do 100 % symulowanych ataków. Kluczowa zmiana dotyczy nie tylko możliwości, lecz także tego, że model można pobrać i modyfikować.
Czytaj →Aktualności · 2026-10-01
Barclays kieruje Claude do 120 000 e-maili dziennie i połowy programistów
Barclays wykorzystuje Claude do obsługi około 120 000 e-maili dziennie, a z asystenta wiedzy korzysta ponad 16 000 pracowników. Do końca 2026 roku Claude Code ma trafić do 50 % programistów, lecz bank ujawnił przede wszystkim skalę, bez danych o błędach i mierzalnych rezultatach.
Czytaj →Aktualności · 2026-09-30
Komora tortur AI bada raczej ludzką projekcję niż ból modelu
Projekt AI Torture Chamber wstrzykiwał lokalnym modelom wektor związany z językiem bólu i kazał im wybierać między dalszym działaniem a utratą checkpointu. Ich prośby brzmią sugestywnie, lecz same nie dowodzą świadomości ani cierpienia.
Czytaj →Aktualności · 2026-09-30
Google udostępnia Gemini 4 Argon bez cyber guardrails tylko zweryfikowanym obrońcom
Gemini 4 Argon trafi najpierw do wybranych obrońców cyberbezpieczeństwa przez Fairwind Program, a Google zamierza udostępnić im model bez cyber guardrails. Ograniczony start jest jednocześnie testem bezpieczeństwa i pokazem nowej władzy dostawcy, który decyduje, kto może używać najmocniejszych funkcji modelu.
Czytaj →Aktualności · 2026-09-30
OpenAI zablokowało sieć 15 000 użytkowników wyciągającą ukryte rozumowanie modeli
OpenAI opisało skoordynowaną kampanię, w której sieć ponad 15 000 użytkowników próbowała pozyskać chronione rozumowanie modeli. Firma łączy główną część aktywności z osobami związanymi z Moonshot AI, ale sama zastrzega, że atrybucja nie obejmuje wszystkich operatorów.
Czytaj →Aktualności · 2026-09-30
Pięć modeli i dziewięć incydentów pokazuje rachunek za szybszą AI
Last Week in AI opisuje tydzień, w którym OpenAI i Anthropic obniżały koszty modeli, a OpenAI ujawniło dziewięć przypadków problematycznego zachowania agentów. To mapa jednego praktycznego konfliktu: tańsza autonomia podnosi koszt nadzoru.
Czytaj →Z Biblioteki
Biblioteka
AI vendor lock-in — gdy model nie jest jedyną zależnością
Uzależnienie od dostawcy AI nie wynika wyłącznie z wyboru modelu. Narasta przez umowy, dane, narzędzia, testy jakości, cenniki i procesy, które z czasem coraz trudniej przenieść.
Czytaj →Biblioteka
Systemy wieloagentowe — kiedy i dlaczego podzielić pracę między role
System wieloagentowy dzieli pracę między wyspecjalizowane agenty. Pomaga, gdy jeden agent gubi się w złożonych zasadach lub narzędziach, ale zwiększa też koordynację, koszty i liczbę miejsc, w których może pojawić się błąd.
Czytaj →Biblioteka
Modele open vs. closed — kto płaci premię za frontier
Model open nie jest automatycznie wolnością, a model closed nie jest automatycznie lock-inem. Praktyczne pytanie brzmi: kiedy kontrola, koszt i lokalne wdrożenie są ważniejsze niż płacenie za frontier capability.
Czytaj →Biblioteka
Niezawodność modeli — gdy ładna odpowiedź nie wystarcza
Niezawodność dotyczy tego, kiedy model wie, kiedy nie wie, kiedy zmyśla i jak często można ufać jego wyjściu w produkcji. Elegancki styl nie jest dowodem.
Czytaj →