Etykieta
#reasoning
Z Radaru
Radar · 2026-07-31
DeepSeek V4 Flash 0731 spycha wydajność agentową w okolice poniżej 0,30 USD za milion tokenów
DeepSeek wydał oficjalny DeepSeek-V4-Flash-0731: wagi MIT, 304B parametrów na HF (Artificial Analysis podaje 284B total / 13B active), mocniejszy agentowy post-training i API około 0,14 USD za milion tokenów wejściowych oraz 0,27-0,28 USD za milion na wyjściu. Willison i Artificial Analysis stawiają go wśród najlepszych open weight modeli pod względem value-per-intelligence.
Czytaj →Radar · 2026-08-03
OpenAI przebudowało stack głosowy: GPT-Live słucha także wtedy, gdy mówi
OpenAI opisało architekturę GPT-Live: full-duplex model głosowy bez turn detectora na ścieżce audio, asynchroniczną delegację do modelu frontier (np. GPT-5.5) oraz transport pod ciągłe audio. Live działa w ChatGPT na płatnych planach, z wariantem mini na free, w limitach planu.
Czytaj →Radar · 2026-07-29
GPT-5.6 skacze w testach inteligencji. Wystarczyło włączyć myślenie w tle
Nowe ustawienia API dla GPT-5.6 pozwalają modelowi zachować logiczny kontekst i skompaktować obliczenia w benchmarku ARC-AGI-3. Zespołom deweloperskim pokazuje to drogę do taniego podniesienia wydajności bez trenowania nowego modelu.
Czytaj →Radar · 2026-07-23
ChatGPT Health dla wszystkich w USA. Kliniczny marketing spotyka pozew
OpenAI od 23 lipca puszcza Health w ChatGPT wszystkim zalogowanym użytkownikom w USA od 18 lat, od free po Pro. Można podłączyć Apple Health i karty szpitalne, firma mówi o 300 milionach zapytań zdrowotnych tygodniowo i jednocześnie ma pozew o niebezpieczną radę.
Czytaj →Radar · 2026-07-24
Fugu Ultra deklaruje do 7,9 punktu przewagi nad v1.0, ale nie pokazuje pełnej metodologii
Według Hardmarua Fugu Ultra v1.1 dynamicznie łączy modele frontier i poprawia wynik nawet o 7,9 punktu względem v1.0. Zapowiedź wzmacnia tezę o wartości orkiestratora, lecz porównanie z Fable 5 pozostaje deklaracją autora bez publicznego evalu.
Czytaj →Radar · 2026-07-01
BAIR pokazuje, dokąd płynie kolejna fala talentu AI
BAIR opublikował showcase 33 doktorantów z rocznika 2026. Celebracja działa tu jak mapa ludzi przechodzących do robotyki, LLM agent systems, AI safety i AI for science.
Czytaj →Radar · 2026-06-24
Google pokazuje, że reasoning potrafi wydobyć także zwykły fakt
Google Research sprawdza, dlaczego chain-of-thought pomaga LLM odpowiadać także na proste pytania faktograficzne. Badanie na Gemini 2.5 i Qwen3-32B wskazuje dwa mechanizmy: dodatkowy czas obliczeń w tokenach oraz factual priming.
Czytaj →Radar · 2026-06-03
GPT-Rosalind przechodzi od benchmarków do kontrolowanej nauki
OpenAI zaktualizowała GPT-Rosalind dla life sciences i oferuje go w research preview wybranym organizacjom globalnie. Ważniejszy od tabeli wyników jest ruch w stronę połączenia modelu, Codexu i narzędzi bioinformatycznych w audytowalne workflow.
Czytaj →