Tag
#reasoning
Z Aktualności
Aktualności · 2026-09-15
Salesforce buduje na Nvidii model AI, który ma odebrać pracę drogim laboratoriom
Nowy model Koa, zbudowany na architekturze open-weight od Nvidii, pokazuje odwrót klientów korporacyjnych od dużych dostawców AI. Firmy nie chcą już wysyłać wrażliwych danych do zamkniętych modeli za miliony dolarów.
Czytaj →Aktualności · 2026-09-09
GPT-6 Astra w końcu wprowadza logikę biznesową i sterowanie PC
OpenAI zaprezentowało model do wdrożeń korporacyjnych, który nie tylko lepiej rozumuje, ale potrafi także aktywnie sterować komputerem. Dla IT i programistów oznacza to konieczność przemyślenia, na co pozwolą agentowi.
Czytaj →Aktualności · 2026-09-09
GPT-6 Astra: Ukryty proces myślowy nie kryje więcej, niż to, czego brakuje w samej architekturze
Analiza Sebastiana Raschki pokazuje, że krótsze ukryte procesy myślowe nowego modelu nie są wynikiem złych intencji, ale efektem ubocznym bardziej wydajnej architektury opartej na tak zwanych zapętlonych transformatorach.
Czytaj →Aktualności · 2026-09-08
Skalowanie agentów pokaże, czy orkiestracja dziesiątek modeli to nie ślepa uliczka
Nathan Lambert z Allen Institute (AI2) zadaje kluczowe pytanie: czy prawa skalowania działają dla rojów agentów tak samo, jak dla wielkości modeli czy inference-time compute? Odpowiedź zadecyduje o kierunku rozwoju AI w biznesie.
Czytaj →Aktualności · 2026-08-11
Słaby model ujawnił ukryte myśli silniejszych braci
Badacze wykorzystali słaby model, aby wyciągnąć ukryte łańcuchy myślowe (chain-of-thought) z tych najsilniejszych. Pokazuje to, że próby ukrywania rozumowania modelu w zaszyfrowanych blokach są na razie iluzją, która przypadkowo ujawnia 704 prywatne artefakty.
Czytaj →Aktualności · 2026-08-12
DeepSeek po cichu uruchomił V4 Pro. Na razie działa tylko przez API
Chiński startup DeepSeek wypuścił nową generację swojego modelu V4 Pro bez oficjalnego komunikatu prasowego. Model o 1,7 T parametrach jest obecnie dostępny przez API na platformie OpenRouter oraz jako wagi na Hugging Face.
Czytaj →Aktualności · 2026-08-13
Wtyczka llm-gemini wspiera modele 3.7 Flash i eksperymenty z narzędziami po stronie serwera
Simon Willison wydał wersję 0.33 swojej wtyczki llm-gemini. Aktualizacja dodaje wsparcie dla 3.7 Flash od Google i otwiera drogę do narzędzi po stronie serwera za pośrednictwem narzędzia CLI LLM w wersji 0.32, które uwidacznia procesy rozumowania modelu.
Czytaj →Aktualności · 2026-08-29
Hy4: Tencent po cichu dogania czołówkę otwartych modeli
Tencent wypuścił nowy, czysto tekstowy model 770B z milionowym kontekstem. Dla programistów open-source oznacza to kolejnego zawodnika wagi ciężkiej poza tradycyjną osią z USA.
Czytaj →Aktualności · 2026-08-26
Qwen3.8-Flash-Next to ogromny model, który oszczędza pamięć
Nowy Qwen to potężny model 125B, z którego w danym momencie działa tylko 6 miliardów parametrów. Pokazuje to drogę do większej wydajności bez utraty pojemności.
Czytaj →Aktualności · 2026-08-21
llm-openrouter 0.7 włącza narzędzia serwerowe, fetch i wyszukiwanie w sieci dla modeli
Simon Willison wydał aktualizację swojej wtyczki do OpenRoutera. Nowa wersja pozwala modelom na bezpośrednie korzystanie z narzędzi serwerowych takich jak Shell, WebFetch i WebSearch.
Czytaj →Aktualności · 2026-08-12
Microsoft testuje rozumienie przestrzeni: Nowy benchmark MindTopo
Microsoft zaprezentował MindTopo, benchmark do testowania przestrzennego i topologicznego wnioskowania modeli wizualnych. Sprawdza on, czy AI rozumie drogi, płoty i przeszkody, a nie tylko nazywa piksele.
Czytaj →Aktualności · 2026-08-11
Microsoft daje modelom Qwen precyzyjne narzędzia do pomiarów radiologicznych
Model Qwen3-VL-4B-Instruct w potoku badawczym Microsoftu nie tylko analizuje zdjęcia rentgenowskie wizualnie, ale uruchamia zewnętrzne narzędzia do obliczania wymiarów. Dla diagnostyki opartej na precyzyjnych progach oznacza to koniec zgadywania kształtów.
Czytaj →Aktualności · 2026-07-18
Reasoning effort staje się regulatorem kosztu, czasu i niezawodności LLM
Sebastian Raschka wyjaśnia, jak LLM uczą się trybów niskiego, średniego i wysokiego reasoning effort. Dla zespołów wdrażających modele praktyczne pytanie brzmi: kiedy płacić za dłuższe myślenie, a kiedy wystarczy tania odpowiedź.
Czytaj →Aktualności · 2026-08-04
LLM 0.32 zamienia CLI Willisona z narzędzia do promptów w runtime agentowy
Simon Willison wydał LLM 0.32, według niego największy skok od startu projektu: ślady reasoning na stderr, server-side tools, logi content-addressable i stream_events. CLI, które wcześniej głównie wysyłało prompty, dźwiga teraz pętle narzędzi z ludzkim stop-go.
Czytaj →Aktualności · 2026-07-31
DeepSeek V4 Flash 0731 spycha wydajność agentową w okolice poniżej 0,30 USD za milion tokenów
DeepSeek wydał oficjalny DeepSeek-V4-Flash-0731: wagi MIT, 304B parametrów na HF (Artificial Analysis podaje 284B total / 13B active), mocniejszy agentowy post-training i API około 0,14 USD za milion tokenów wejściowych oraz 0,27-0,28 USD za milion na wyjściu. Willison i Artificial Analysis stawiają go wśród najlepszych open weight modeli pod względem value-per-intelligence.
Czytaj →Aktualności · 2026-08-03
OpenAI przebudowało stack głosowy: GPT-Live słucha także wtedy, gdy mówi
OpenAI opisało architekturę GPT-Live: full-duplex model głosowy bez turn detectora na ścieżce audio, asynchroniczną delegację do modelu frontier (np. GPT-5.5) oraz transport pod ciągłe audio. Live działa w ChatGPT na płatnych planach, z wariantem mini na free, w limitach planu.
Czytaj →Aktualności · 2026-07-29
GPT-5.6 skacze w testach inteligencji. Wystarczyło włączyć myślenie w tle
Nowe ustawienia API dla GPT-5.6 pozwalają modelowi zachować logiczny kontekst i skompaktować obliczenia w benchmarku ARC-AGI-3. Zespołom deweloperskim pokazuje to drogę do taniego podniesienia wydajności bez trenowania nowego modelu.
Czytaj →Aktualności · 2026-07-23
ChatGPT Health dla wszystkich w USA. Kliniczny marketing spotyka pozew
OpenAI od 23 lipca puszcza Health w ChatGPT wszystkim zalogowanym użytkownikom w USA od 18 lat, od free po Pro. Można podłączyć Apple Health i karty szpitalne, firma mówi o 300 milionach zapytań zdrowotnych tygodniowo i jednocześnie ma pozew o niebezpieczną radę.
Czytaj →Aktualności · 2026-07-24
Fugu Ultra deklaruje do 7,9 punktu przewagi nad v1.0, ale nie pokazuje pełnej metodologii
Według Hardmarua Fugu Ultra v1.1 dynamicznie łączy modele frontier i poprawia wynik nawet o 7,9 punktu względem v1.0. Zapowiedź wzmacnia tezę o wartości orkiestratora, lecz porównanie z Fable 5 pozostaje deklaracją autora bez publicznego evalu.
Czytaj →Aktualności · 2026-07-01
BAIR pokazuje, dokąd płynie kolejna fala talentu AI
BAIR opublikował showcase 33 doktorantów z rocznika 2026. Celebracja działa tu jak mapa ludzi przechodzących do robotyki, LLM agent systems, AI safety i AI for science.
Czytaj →Aktualności · 2026-06-24
Google pokazuje, że reasoning potrafi wydobyć także zwykły fakt
Google Research sprawdza, dlaczego chain-of-thought pomaga LLM odpowiadać także na proste pytania faktograficzne. Badanie na Gemini 2.5 i Qwen3-32B wskazuje dwa mechanizmy: dodatkowy czas obliczeń w tokenach oraz factual priming.
Czytaj →Aktualności · 2026-06-03
GPT-Rosalind przechodzi od benchmarków do kontrolowanej nauki
OpenAI zaktualizowała GPT-Rosalind dla life sciences i oferuje go w research preview wybranym organizacjom globalnie. Ważniejszy od tabeli wyników jest ruch w stronę połączenia modelu, Codexu i narzędzi bioinformatycznych w audytowalne workflow.
Czytaj →Z Biblioteki