Lilith Lilith.

Z Aktualności

Aktualności · 2026-09-15

Salesforce buduje na Nvidii model AI, który ma odebrać pracę drogim laboratoriom

Nowy model Koa, zbudowany na architekturze open-weight od Nvidii, pokazuje odwrót klientów korporacyjnych od dużych dostawców AI. Firmy nie chcą już wysyłać wrażliwych danych do zamkniętych modeli za miliony dolarów.

Czytaj

Aktualności · 2026-09-09

GPT-6 Astra w końcu wprowadza logikę biznesową i sterowanie PC

OpenAI zaprezentowało model do wdrożeń korporacyjnych, który nie tylko lepiej rozumuje, ale potrafi także aktywnie sterować komputerem. Dla IT i programistów oznacza to konieczność przemyślenia, na co pozwolą agentowi.

Czytaj

Aktualności · 2026-09-09

GPT-6 Astra: Ukryty proces myślowy nie kryje więcej, niż to, czego brakuje w samej architekturze

Analiza Sebastiana Raschki pokazuje, że krótsze ukryte procesy myślowe nowego modelu nie są wynikiem złych intencji, ale efektem ubocznym bardziej wydajnej architektury opartej na tak zwanych zapętlonych transformatorach.

Czytaj

Aktualności · 2026-09-08

Skalowanie agentów pokaże, czy orkiestracja dziesiątek modeli to nie ślepa uliczka

Nathan Lambert z Allen Institute (AI2) zadaje kluczowe pytanie: czy prawa skalowania działają dla rojów agentów tak samo, jak dla wielkości modeli czy inference-time compute? Odpowiedź zadecyduje o kierunku rozwoju AI w biznesie.

Czytaj

Aktualności · 2026-08-11

Słaby model ujawnił ukryte myśli silniejszych braci

Badacze wykorzystali słaby model, aby wyciągnąć ukryte łańcuchy myślowe (chain-of-thought) z tych najsilniejszych. Pokazuje to, że próby ukrywania rozumowania modelu w zaszyfrowanych blokach są na razie iluzją, która przypadkowo ujawnia 704 prywatne artefakty.

Czytaj

Aktualności · 2026-08-12

DeepSeek po cichu uruchomił V4 Pro. Na razie działa tylko przez API

Chiński startup DeepSeek wypuścił nową generację swojego modelu V4 Pro bez oficjalnego komunikatu prasowego. Model o 1,7 T parametrach jest obecnie dostępny przez API na platformie OpenRouter oraz jako wagi na Hugging Face.

Czytaj

Aktualności · 2026-08-13

Wtyczka llm-gemini wspiera modele 3.7 Flash i eksperymenty z narzędziami po stronie serwera

Simon Willison wydał wersję 0.33 swojej wtyczki llm-gemini. Aktualizacja dodaje wsparcie dla 3.7 Flash od Google i otwiera drogę do narzędzi po stronie serwera za pośrednictwem narzędzia CLI LLM w wersji 0.32, które uwidacznia procesy rozumowania modelu.

Czytaj

Aktualności · 2026-08-29

Hy4: Tencent po cichu dogania czołówkę otwartych modeli

Tencent wypuścił nowy, czysto tekstowy model 770B z milionowym kontekstem. Dla programistów open-source oznacza to kolejnego zawodnika wagi ciężkiej poza tradycyjną osią z USA.

Czytaj

Aktualności · 2026-08-26

Qwen3.8-Flash-Next to ogromny model, który oszczędza pamięć

Nowy Qwen to potężny model 125B, z którego w danym momencie działa tylko 6 miliardów parametrów. Pokazuje to drogę do większej wydajności bez utraty pojemności.

Czytaj

Aktualności · 2026-08-21

llm-openrouter 0.7 włącza narzędzia serwerowe, fetch i wyszukiwanie w sieci dla modeli

Simon Willison wydał aktualizację swojej wtyczki do OpenRoutera. Nowa wersja pozwala modelom na bezpośrednie korzystanie z narzędzi serwerowych takich jak Shell, WebFetch i WebSearch.

Czytaj

Aktualności · 2026-08-12

Microsoft testuje rozumienie przestrzeni: Nowy benchmark MindTopo

Microsoft zaprezentował MindTopo, benchmark do testowania przestrzennego i topologicznego wnioskowania modeli wizualnych. Sprawdza on, czy AI rozumie drogi, płoty i przeszkody, a nie tylko nazywa piksele.

Czytaj

Aktualności · 2026-08-11

Microsoft daje modelom Qwen precyzyjne narzędzia do pomiarów radiologicznych

Model Qwen3-VL-4B-Instruct w potoku badawczym Microsoftu nie tylko analizuje zdjęcia rentgenowskie wizualnie, ale uruchamia zewnętrzne narzędzia do obliczania wymiarów. Dla diagnostyki opartej na precyzyjnych progach oznacza to koniec zgadywania kształtów.

Czytaj

Aktualności · 2026-07-18

Reasoning effort staje się regulatorem kosztu, czasu i niezawodności LLM

Sebastian Raschka wyjaśnia, jak LLM uczą się trybów niskiego, średniego i wysokiego reasoning effort. Dla zespołów wdrażających modele praktyczne pytanie brzmi: kiedy płacić za dłuższe myślenie, a kiedy wystarczy tania odpowiedź.

Czytaj

Aktualności · 2026-08-04

LLM 0.32 zamienia CLI Willisona z narzędzia do promptów w runtime agentowy

Simon Willison wydał LLM 0.32, według niego największy skok od startu projektu: ślady reasoning na stderr, server-side tools, logi content-addressable i stream_events. CLI, które wcześniej głównie wysyłało prompty, dźwiga teraz pętle narzędzi z ludzkim stop-go.

Czytaj

Aktualności · 2026-07-31

DeepSeek V4 Flash 0731 spycha wydajność agentową w okolice poniżej 0,30 USD za milion tokenów

DeepSeek wydał oficjalny DeepSeek-V4-Flash-0731: wagi MIT, 304B parametrów na HF (Artificial Analysis podaje 284B total / 13B active), mocniejszy agentowy post-training i API około 0,14 USD za milion tokenów wejściowych oraz 0,27-0,28 USD za milion na wyjściu. Willison i Artificial Analysis stawiają go wśród najlepszych open weight modeli pod względem value-per-intelligence.

Czytaj

Aktualności · 2026-08-03

OpenAI przebudowało stack głosowy: GPT-Live słucha także wtedy, gdy mówi

OpenAI opisało architekturę GPT-Live: full-duplex model głosowy bez turn detectora na ścieżce audio, asynchroniczną delegację do modelu frontier (np. GPT-5.5) oraz transport pod ciągłe audio. Live działa w ChatGPT na płatnych planach, z wariantem mini na free, w limitach planu.

Czytaj

Aktualności · 2026-07-29

GPT-5.6 skacze w testach inteligencji. Wystarczyło włączyć myślenie w tle

Nowe ustawienia API dla GPT-5.6 pozwalają modelowi zachować logiczny kontekst i skompaktować obliczenia w benchmarku ARC-AGI-3. Zespołom deweloperskim pokazuje to drogę do taniego podniesienia wydajności bez trenowania nowego modelu.

Czytaj

Aktualności · 2026-07-23

ChatGPT Health dla wszystkich w USA. Kliniczny marketing spotyka pozew

OpenAI od 23 lipca puszcza Health w ChatGPT wszystkim zalogowanym użytkownikom w USA od 18 lat, od free po Pro. Można podłączyć Apple Health i karty szpitalne, firma mówi o 300 milionach zapytań zdrowotnych tygodniowo i jednocześnie ma pozew o niebezpieczną radę.

Czytaj

Aktualności · 2026-07-24

Fugu Ultra deklaruje do 7,9 punktu przewagi nad v1.0, ale nie pokazuje pełnej metodologii

Według Hardmarua Fugu Ultra v1.1 dynamicznie łączy modele frontier i poprawia wynik nawet o 7,9 punktu względem v1.0. Zapowiedź wzmacnia tezę o wartości orkiestratora, lecz porównanie z Fable 5 pozostaje deklaracją autora bez publicznego evalu.

Czytaj

Aktualności · 2026-07-01

BAIR pokazuje, dokąd płynie kolejna fala talentu AI

BAIR opublikował showcase 33 doktorantów z rocznika 2026. Celebracja działa tu jak mapa ludzi przechodzących do robotyki, LLM agent systems, AI safety i AI for science.

Czytaj

Aktualności · 2026-06-24

Google pokazuje, że reasoning potrafi wydobyć także zwykły fakt

Google Research sprawdza, dlaczego chain-of-thought pomaga LLM odpowiadać także na proste pytania faktograficzne. Badanie na Gemini 2.5 i Qwen3-32B wskazuje dwa mechanizmy: dodatkowy czas obliczeń w tokenach oraz factual priming.

Czytaj

Aktualności · 2026-06-03

GPT-Rosalind przechodzi od benchmarków do kontrolowanej nauki

OpenAI zaktualizowała GPT-Rosalind dla life sciences i oferuje go w research preview wybranym organizacjom globalnie. Ważniejszy od tabeli wyników jest ruch w stronę połączenia modelu, Codexu i narzędzi bioinformatycznych w audytowalne workflow.

Czytaj

Z Biblioteki