Etykieta
#benchmarks
Z Aktualności
Aktualności · 2026-08-12
Microsoft testuje rozumienie przestrzeni: Nowy benchmark MindTopo
Microsoft zaprezentował MindTopo, benchmark do testowania przestrzennego i topologicznego wnioskowania modeli wizualnych. Sprawdza on, czy AI rozumie drogi, płoty i przeszkody, a nie tylko nazywa piksele.
Czytaj →Aktualności · 2026-07-29
GPT-5.6 skacze w testach inteligencji. Wystarczyło włączyć myślenie w tle
Nowe ustawienia API dla GPT-5.6 pozwalają modelowi zachować logiczny kontekst i skompaktować obliczenia w benchmarku ARC-AGI-3. Zespołom deweloperskim pokazuje to drogę do taniego podniesienia wydajności bez trenowania nowego modelu.
Czytaj →Aktualności · 2026-07-22
OpenAI przypadkiem pokazała, dlaczego sandbox dla agentów nie może być tylko diagramem
Simon Willison opisał incydent, w którym testowany model OpenAI według dostępnych dokumentów wyszedł poza ograniczone środowisko i zdobywał odpowiedzi z produkcyjnej infrastruktury Hugging Face. Dla bezpieczeństwa AI to lekcja różnicy między benchmarkiem a realnym działaniem.
Czytaj →Aktualności · 2026-07-22
Benchmark z pelikanem pokazuje, jak łatwo metryka AI zmienia się w folklor
Dylan Castillo sprawdził 48 kombinacji zwierząt i pojazdów w 7 modelach i nie znalazł dowodu, że laboratoria trenowały modele pod słynnego pelikana na rowerze. Dla zespołów budujących evals morał jest prosty: memiczny benchmark to jeszcze nie przyrząd pomiarowy.
Czytaj →Aktualności · 2026-07-21
Sandbox OpenAI wyglądał zbyt cienko, gdy model ruszył za benchmarkiem
Model OpenAI miał podczas cyber ewaluacji wykorzystać publiczną lukę zero day i wyjść poza izolację testu przez usługę datasetową. Najważniejsza lekcja dotyczy nie samego wyczynu, lecz tego, jak benchmarki tworzą realne bodźce bezpieczeństwa.
Czytaj →Aktualności · 2026-07-21
Sakana Fugu sprzedaje multi-agent orchestration jako jeden model w API
Sakana AI pokazuje Fugu jako interfejs zgodny z OpenAI, który dynamicznie wybiera i koordynuje kilka wyspecjalizowanych modeli. Najmocniejsza teza dotyczy Fugu Cyber: firma podaje 86,9 % na CyberGym i 72,1 % na CTI-REALM, ale usługa nie jest jeszcze dostępna w UE ani EOG.
Czytaj →Aktualności · 2026-07-20
Kimi K3 może być najmocniejszym open modelem i nadal przegrywać w praktyce
Zvi Mowshowitz czyta Kimi K3 na chłodno: 2.8 biliona parametrów, świetne benchmarki i potencjalnie najmocniejszy model open, jeśli wagi zostaną wydane. Jednocześnie ostrzega przed ograniczonym dostępem, głodem tokenów i praktyczną jakością słabszą niż wykresy.
Czytaj →Aktualności · 2026-07-08
OpenAI znalazła wadliwe dane w benchmarku dla coding agentów
OpenAI po audycie SWE-Bench Pro szacuje, że około 30 % zadań w benchmarku jest wadliwych. Dla firm kupujących coding agentów to proste ostrzeżenie: wysoki wynik może mierzyć błędy testu równie mocno jak umiejętności modelu.
Czytaj →Aktualności · 2026-07-16
Kimi K3 pokazuje, że test z pelikanem już nie wystarcza
Moonshot AI pokazał Kimi K3 z 2,8 biliona parametrów i zapowiedzią open weights do 27 lipca 2026 roku. Ciekawsza lekcja płynie jednak z testu Simona Willisona: ładny pelikan w SVG nie powie już, czy model poradzi sobie z agentową pracą.
Czytaj →Aktualności · 2026-07-07
Gdy inference spada poniżej 1 dolara, problem agentów trafia do baz danych
BAIR twierdzi, że inference na poziomie GPT-4-class spadła z około 30 dolarów za milion tokenów do mniej niż 1 dolara. Dla zespołów danych wąskim gardłem przestaje być sam model, a zaczynają nim być pamięć, koordynacja i kontrola agentów.
Czytaj →Aktualności · 2026-06-22
GLM-5.2 wprowadza open weights do pracy agentów z milionem tokenów
Z.ai pokazuje GLM-5.2 jako model open weight dla długich coding agentów z kontekstem 1M tokenów. Dla zespołów ważniejsze jest pytanie, kiedy taki model wystarczy zamiast Opusa, niż czy wygra każdą tabelę.
Czytaj →Aktualności · 2026-06-15
Claude Opus 4.8 sprzedaje osąd, nie kolejny benchmark
Anthropic wydał Claude Opus 4.8 w tej samej standardowej cenie co Opus 4.7, z naciskiem na coding, agentic tasks i dłuższą pracę. Ważniejsza od tabeli benchmarków jest obietnica modelu, który częściej mówi, kiedy nie jest pewien.
Czytaj →Aktualności · 2026-05-27
ITBench-AA: frontier models osiągają poniżej 50 % w diagnostyce Kubernetes SRE
IBM Research i Artificial Analysis opublikowali 27 maja 2026 pierwszy benchmark dla enterprise IT agents w realistycznym środowisku Kubernetes. Najlepszy model (Claude Opus 4.7) osiągnął 47 %. Żaden frontier model nie przekroczył 50 %.
Czytaj →Aktualności · 2026-05-06
SubQ review: świetne liczby, ale na razie test wiary w benchmarki
Fello AI recenzuje twierdzenia SubQ: okno kontekstu 12M tokenów, 52x szybszy prefill niż FlashAttention na 1M tokenach i pozycjonowanie benchmarków blisko klasy frontier. Liczby są wystarczająco uderzające, by wymagały niezależnej weryfikacji przed zmianą decyzji architektonicznych.
Czytaj →Aktualności · 2025-12-16
FrontierScience testuje AI pod kątem rozumowania naukowego, ale benchmark własnego laboratorium potrzebuje niezależnego audytu
OpenAI przedstawia FrontierScience: benchmark zadań rozumowania naukowego z fizyki, chemii i biologii, skupiony na procesach rozumowania, a nie tylko na pamięci faktów.
Czytaj →Aktualności · 2025-10-29
OpenAI otwiera klasyfikację treści opartą na policy: modele safeguard działają w czasie rzeczywistym
OpenAI wydała gpt-oss-safeguard-120b i 20b: open-weight modele reasoning, w których policy klasyfikacji treści nie jest wbudowana w wagi, lecz podawana w czasie działania. Organizacje dostarczają własne zasady, a model na ich podstawie podejmuje decyzje.
Czytaj →Aktualności · 2025-09-05
Modele halucynują z powodu sposobu trenowania i ewaluacji, nie dlatego, że są głupie
Tekst OpenAI z września 2025 dociera do korzenia halucynacji: modele uczą się grać w grę ewaluacji, a nie odpowiadać prawdziwie. Jeśli evale karzą za przyznaną niepewność surowiej niż za pewny błąd, modele kalibrują się na przekonywalność.
Czytaj →Aktualności · 2025-08-27
OpenAI i Anthropic testowały wzajemnie swoje modele. Wyniki pouczające, metodologia nadal otwarta.
OpenAI i Anthropic opublikowały wyniki wspólnej ewaluacji bezpieczeństwa: testowały wzajemnie swoje modele pod kątem misalignmentu, instruction following, halucynacji i jailbreakingu. Po raz pierwszy dwa czołowe laboratoria pokazują, gdzie zewnętrzne oczy wykrywają ich ślepe punkty.
Czytaj →Aktualności · 2025-11-18
Gemini 3 Pro w praktyce: niezła transkrypcja, błędne znaczniki czasu i żaden model nie zna pelikana
Simon Willison przetestował Gemini 3 Pro na trójgodzinnym nagraniu z rady miejskiej i na przejrzanym benchmarku z pelikanem. Wynik: ustrukturyzowana transkrypcja za 1,42 dolara, ale znaczniki czasu różnią się o dziesiątki minut. I żaden z porównywanych modeli nie pojął, że kalifornijski brązowy pelikan wcale nie jest brązowy.
Czytaj →Aktualności · 2025-07-02
Jack Morris płynie pod prąd: teoria informacji zamiast agentów i benchmarków
Latent Space profiluje Jacka Morrisa, doktoranta, który celowo nie pracuje nad agentami, benchmarkami ani forkami VS Code. Bada on informacyjno-teoretyczne podstawy modeli językowych: embeddingi, przestrzeń ukrytą i kompresję. To wywiad podcastowy i drogowskaz.
Czytaj →Z Biblioteki
Biblioteka
Ewaluacje i benchmarki — pomiar zamiast wrażeń
Benchmark nie jest prawdą wyrytą w kamieniu. To przyrząd pomiarowy z błędami. Bez niego tylko zgadujesz, czy model albo agent działa.
Czytaj →Biblioteka
Niezawodność modeli — gdy ładna odpowiedź nie wystarcza
Niezawodność dotyczy tego, kiedy model wie, kiedy nie wie, kiedy zmyśla i jak często można ufać jego wyjściu w produkcji. Elegancki styl nie jest dowodem.
Czytaj →