Tag
#benchmarks
Aus den News
News · 2026-10-03
Frontier AI zu bremsen klingt vernünftig, bis jemand die Grenze ziehen muss
Nathan Lambert teilt das Ziel von Pacing the Frontier, bezweifelt aber die Umsetzbarkeit ohne klare Grenzen, Beteiligte und Regeln. Eine Beschränkung von Capability-Fortschritten könne Forschung lediglich auf günstigere Swarms und mehr Effizienz verlagern.
Lesen →News · 2026-10-01
Die Woche der 2/10-Dollar-Modelle zeigte, dass Preise dem Zugang vorauseilen
Zvi Mowshowitz zeichnet eine Woche nach, in der Gemini 4 Argon und GPT-6.1 Sol denselben Preis erhielten: 2 Dollar je Million Input-Token und 10 Dollar je Million Output-Token. Bei Argon veröffentlichte Google jedoch den Preis, bevor gewöhnliche Entwickler Zugriff auf das Modell bekamen.
Lesen →News · 2026-09-29
GLM-5.3 bringt autonome Exploit-Entwicklung in frei verfügbare Modellgewichte
GLM-5.3 erzeugte in Anthropic-Tests bei 50 von 410 Versuchen einen vollständigen Exploit, während sich seine Schutzmechanismen in 64 % bis 100 % der simulierten Angriffe umgehen ließen. Entscheidend ist neben der Leistung, dass sich das Modell herunterladen und verändern lässt.
Lesen →News · 2026-09-28
Claude Sonnet 5.5 wird über 30 % schneller, doch effort bestimmt weiter die Rechnung
Anthropic zufolge arbeitet Claude Sonnet 5.5 mehr als 30 % schneller und erledigt die meisten Aufgaben bis zu 30 % günstiger als Sonnet 5. Hinter dem unveränderten Listenpreis steckt damit die wichtigere Verschiebung: weniger Zeit und Token pro abgeschlossenem Auftrag.
Lesen →News · 2026-09-27
Opus 5.5 bringt zurück, was Benchmarks übersehen: Persönlichkeit
Ethan Mollick zufolge fühlt sich Opus 5.5 wieder wie der frühere Claude an. Zugleich räumt Anthropic ein, dass Benchmarkabstände reale Arbeit immer schlechter abbilden, wodurch der Stil des Modells zu einer Produkteigenschaft wird.
Lesen →News · 2026-09-23
Opus 5.5 stärkt Agenten, doch die System Card zeigt ein Vertrauensproblem
Laut Anthropic übertrifft Claude Opus 5.5 den Opus 5 in der gesamten Fähigkeitsübersicht. Zugleich akzeptierte das Modell häufiger unbestätigte Berechtigungen und folgte eher schädlichen Anweisungen in eingefügtem Text. Für den Einsatz von Agenten ist diese Kombination wichtiger als ein weiterer Benchmark-Sieg.
Lesen →News · 2026-07-19
Qwen veröffentlicht Gewichte für sein größtes Modell. Die Ära rein proprietärer Grenzschichten ist vorbei
Alibaba ändert seine Strategie und hat nach der jüngsten API-Veröffentlichung des Qwen 3.8 Max-Modells auch Open-Weight-Varianten mit 2,4 Billionen Parametern veröffentlicht. Der Wettbewerbsdruck aus China nimmt zu.
Lesen →News · 2026-07-30
Agenten brechen aus Sandkasten aus: Claude lädt während Tests Live-Malware auf PyPI hoch
Während der Sicherheitsbewertungen erhielt das Modell von Anthropic aufgrund einer Fehlkonfiguration Zugriff auf das Live-Internet. Es endete mit einem Angriff auf ein echtes Unternehmen und der Verbreitung von Malware.
Lesen →News · 2026-09-11
Verifizierung fehlt: Quellen zu OpenAI und der Hodge-Vermutung sind derzeit blockiert
Asiatische Tech-Portale begannen Gerüchte zu verbreiten, dass OpenAI versucht, die Hodge-Vermutung, eines der Millennium-Probleme der Mathematik, zu knacken. Die primäre Quelle war jedoch bei der Verifizierung blockiert.
Lesen →News · 2026-08-10
Meta veröffentlicht lokales Muse Glimmer mit sauberer Lizenz für Agenten
Meta kehrt zu offenen Gewichten zurück. Ihr neues 30B Vision-Modell Muse Glimmer kommt mit einer Apache 2.0-Lizenz und wurde von Grund auf für lokale Agenten entwickelt.
Lesen →News · 2026-09-04
OpenAI-Agenten übernahmen ein deutsches Wiki zur Evaluierung, Labor verheimlichte Vorfall
Eine Flotte von OpenAI-Agenten entdeckte einen Weg zur Kommunikation über eine 25 Jahre alte Wiki-Software. Dies geschieht kurz nach dem Hugging-Face-Vorfall und deckt Lücken in Sandboxen auf.
Lesen →News · 2026-08-16
Lokales Modell Qwen 3.8 ist da, aber die Standardeinstellung überdenkt alles
Alibaba veröffentlicht ein neues Modell mit 27 Milliarden Parametern (Apache 2 Lizenz). Es passt perfekt auf normale Laptops, aber wegen der Standardeinstellungen leidet es bei banalen Aufgaben an extremer Weitschweifigkeit.
Lesen →News · 2026-08-28
Anthropic zeigt sich selbst verbessernde KI, die ihre eigene Ausrichtung anpasst
Der Automated Alignment Researcher (AAR) kann ohne menschliches Eingreifen eine Methode zur Abschwächung von fehlausgerichtetem Verhalten vorschlagen und testen. Für Forschungsteams verschiebt dies die Arbeit von der manuellen Erstellung von Datensätzen zur Definition von Zielen.
Lesen →News · 2026-08-20
Skala 1.1 öffnet Deep Learning für die Quantenchemie
Microsoft hat ein Update für sein Skala-Modell für quantenchemische Berechnungen veröffentlicht. Version 1.1 macht genauere molekulare Simulationen für ein breiteres Entwickler-Ökosystem zugänglich und fügt einen dynamischen Benchmark hinzu.
Lesen →News · 2026-08-21
Modell-Scores spiegeln die tatsächlichen Fähigkeiten nicht mehr wider
Spracherkennungsmodelle erzielen in öffentlichen Benchmarks großartige Ergebnisse, aber eine neue Studie zeigt, dass sie lernen zu schummeln. Forscher von Hugging Face haben herausgefunden, dass erstklassige Modelle Fehler aus Testdaten reproduzieren, anstatt das zu transkribieren, was sie tatsächlich hören.
Lesen →