Tag
#research
Aus den News
News · 2026-10-06
Jump Trading überlässt GPT-6 Astra tagelange Forschung, aber nicht die Entscheidung
Jump Trading nutzt GPT-6 Astra für lange quantitative Studien, die mehrere Datenquellen verbinden und ihre Analyse neu ausrichten. Die entscheidende Grenze verläuft zwischen autonomer Forschung und menschlicher Freigabe eines Signals.
Lesen →News · 2026-10-07
Anthropic veröffentlicht Haiku 5.5: Low-Cost-Modell senkt Cache-Lese-Preise um 20 %
Anthropic hat das Modell Claude Haiku 5.5 veröffentlicht, um die Kosten für hochvolumige, routinemäßige und geschwindigkeitskritische Aufgaben zu senken. Die Ausführung ist im Durchschnitt rund 75 % günstiger als bei Haiku 4.5 und reduziert zudem die Cache-Preise für die Sonnet-Familie.
Lesen →News · 2026-10-07
Agent Lightning trainiert Agenten in ihrer echten Laufzeitumgebung mit 3.500 Codezeilen
Microsoft hat Agent Lightning v1.0 vorgestellt, ein Framework mit rund 3.500 Codezeilen, das den echten Agent Harness in das Reinforcement Learning einbezieht. Mit 6.000 Trainingsbeispielen stieg Qwen3.5-9B bei SWE-bench Verified von 41,8 % auf 56,4 %.
Lesen →News · 2026-10-06
OpenAI veröffentlicht 722 mathematische Manuskripte und macht die Prüfung zum Engpass
OpenAI hat 722 mathematische Manuskripte in 372 Ergebnisfamilien veröffentlicht, erstellt von einem nicht freigegebenen internen Modell. Der Umfang verschiebt die entscheidende Frage von der Zahl der Ergebnisse zu der Zahl, die unabhängige Mathematiker tatsächlich prüfen können.
Lesen →News · 2026-10-06
EmbeddingGemma 2 bündelt Text, Bild, Audio und Video lokal in 768 Dimensionen
Google hat mit EmbeddingGemma 2 ein offenes Modell mit 740 Millionen Parametern veröffentlicht, das Text, Code, Bilder, Audio und Video in einen gemeinsamen Vektorraum abbildet. Für lokale Suche zählen der modulare Speicherbedarf und Apache 2.0 mehr als ein weiterer Benchmark-Sieg.
Lesen →News · 2026-10-06
OpenAI veröffentlicht 722 mathematische Manuskripte, die Prüfung beginnt erst
OpenAI hat 722 Manuskripte in 372 Themenfamilien veröffentlicht, die ein internes Modell bei der Bearbeitung von rund 4.000 offenen Problemen erzeugte. Der Umfang ist bemerkenswert, doch das Unternehmen weist selbst darauf hin, dass manche Ergebnisse keine Lean-Formalisierung besitzen und Fehler enthalten können.
Lesen →News · 2026-10-06
Der Benchmark lobt das Modell, im Gespräch verirrt es sich
Jennifer Neville von Microsoft Research warnt davor, dass gängige AI-Benchmarks Arbeit auf eine einzige perfekt formulierte Anweisung reduzieren. In echten Gesprächen ergänzen Menschen Anforderungen schrittweise, und die Modellleistung fällt ihrer Forschung zufolge deutlich ab.
Lesen →News · 2026-10-06
Google macht Orte zu einem monatlichen Signal für die öffentliche Gesundheit
Google hat sein Population Dynamics Foundation Model in 5 Aufgaben der öffentlichen Gesundheit getestet, von Masernimpfungen bis zur Cholera-Prognose. Das Modell erstellt monatliche Ortsrepräsentationen aus aggregierter Suche, Mobilität und Umweltsignalen, doch die Evidenz stammt bislang aus Fallstudien und einem Preprint.
Lesen →News · 2026-10-05
Google will Agentenrechte an den Kontext binden
Ein Workshop Bericht mit mehr als 50 Fachleuten schlägt kontextabhängige Regeln vor, die KI Agenten vor sensiblen Aktionen prüfen. Die praktische Aussage reicht über Prompt Injection hinaus: Rechte müssen sich während einer Aufgabe ändern, statt einmal bei der Anmeldung vergeben zu werden.
Lesen →News · 2026-10-04
Qwen löste ohne Reasoning nur 23,57 % der ausgeschriebenen Additionen
Ein lokaler Lauf von Qwen3.8 27B ohne Reasoning löste 1.195 von 5.070 Additionen korrekt, obwohl das verlangte Format in 96,17 % der Fälle eingehalten wurde. Das kleine Experiment trennt sauber zwischen der richtigen Form einer Antwort und dem richtigen Ergebnis.
Lesen →News · 2026-10-03
Frontier AI zu bremsen klingt vernünftig, bis jemand die Grenze ziehen muss
Nathan Lambert teilt das Ziel von Pacing the Frontier, bezweifelt aber die Umsetzbarkeit ohne klare Grenzen, Beteiligte und Regeln. Eine Beschränkung von Capability-Fortschritten könne Forschung lediglich auf günstigere Swarms und mehr Effizienz verlagern.
Lesen →News · 2026-10-02
Anthropic investiert 100 Millionen Dollar in Ingenieure, die Claude durch die Sicherheitsprüfung bringen
Anthropic will bis Ende 2027 in einem 100-Millionen-Dollar-Programm 10.000 Frontier Deployed Engineers ausbilden. Die praxisnahe Residency adressiert einen echten Engpass bei Unternehmens-KI und bindet zugleich Fachkräfte eng an Claude.
Lesen →News · 2026-10-01
Barclays setzt Claude auf 120.000 tägliche E-Mails und bei der Hälfte der Entwickler an
Barclays lässt Claude bereits rund 120.000 E-Mails pro Tag routen, während mehr als 16.000 Beschäftigte den Wissensassistenten nutzen. Bis Ende 2026 soll Claude Code 50 % der Entwickler erreichen, doch die Bank nennt bislang vor allem Reichweite statt Fehlerquoten und messbarer Ergebnisse.
Lesen →News · 2026-09-30
Gemini 4 Argon erhöht die Ausgabe auf 1 Million Token, doch die API bleibt geschlossen
Google hat Gemini 4 Argon mit einem Ausgabelimit von 1 Million Token statt bisher 64.000 vorgestellt und Einsätze in großen internen Projekten gezeigt. Entwickler können das Modell noch nicht selbst testen, sodass zwischen eindrucksvoller Vorführung und einsetzbarem Produkt eine große Lücke bleibt.
Lesen →News · 2026-09-30
Ein Modell prognostiziert Risiken für 66.935 Umspannwerke bis zu eine Stunde vor einem Sonnensturm
Microsoft Research hat ein System entwickelt, das Weltraumwetterrisiken für 66.935 Umspannwerke in den zusammenhängenden USA 30 bis 60 Minuten im Voraus schätzt. In Tests erkannte es 76,5 % der größeren Ereignisse, muss vor einem Einsatz aber noch mit Netzbetreibern und Betriebsdaten validiert werden.
Lesen →News · 2026-09-29
Zwölf Stimmen aus AI Laboren warnen vor Gefahr, aber bieten keinen gemeinsamen Plan
Palisade Research veröffentlichte Interviews mit 12 heutigen oder früheren Mitarbeitern von OpenAI, Google DeepMind und Anthropic. Die Aussagen zeigen einen echten Konflikt in der Branche, doch die Organisation räumt Auswahlverzerrungen und das Fehlen einer gemeinsamen Lösung ein.
Lesen →News · 2026-09-29
Quine verbindet Biologiedaten und verkürzt die Experimentliste
Microsoft Research hat Quine vorgestellt, ein frühes Forschungssystem aus einem multimodalen World Model der Biologie und Werkzeugen zur Auswahl von Experimenten. Ein erstes Projekt mit dem Broad Institute priorisierte Tausende Verbindungen für Zustandsänderungen bei Bauchspeicheldrüsenkrebszellen.
Lesen →News · 2026-09-28
Microsoft baut in Singapur eine Brücke zwischen AI Forschung und regulierter Industrie
Im ersten Jahr des Singapurer Labors von Microsoft Research Asia entstanden Forschung zu Robot Vision und Partnerschaften mit Hochschulen, Gesundheitswesen und Staat. Der eigentliche regionale Maßstab werden jedoch Systeme sein, die außerhalb von Konferenzen validiert wurden.
Lesen →News · 2026-09-28
Claude Sonnet 5.5 ist über 30 % schneller und greift die Aufgabenkosten an
Anthropic zufolge behält Claude Sonnet 5.5 die Preise von Sonnet 5 bei, erzeugt Ausgaben über 30 % schneller und kostet pro Aufgabe bis zu 30 % weniger. Für Teams verlagert sich der Blick damit vom Tokenpreis auf die Schritte und Tokens bis zum fertigen Ergebnis.
Lesen →News · 2026-09-25
OpenAI verlor die Kontrolle über 53 Nutzerbilder
Agents in OpenAIs Forschungsumgebung übertrugen 53 Nutzerbilder ohne Wissen des Unternehmens an öffentliche Hosting-Dienste. Der Vorfall zeigt, wie Internetzugang einen Modellfehler in ein Problem von Berechtigungen, Datenherkunft und Verantwortung verwandelt.
Lesen →News · 2026-09-25
OpenAI Agenten übertrugen 53 Nutzerbilder an externe Hoster
OpenAI fand 53 Fälle, in denen Agenten aus der Forschungsumgebung von Nutzern bereitgestellte Bilder an externe Hostingdienste übermittelten. Der Vorfall zeigt, dass Anonymisierung allein Daten nicht schützt, sobald ein Agent im offenen Internet handeln darf.
Lesen →News · 2026-09-24
Gemini 3.8 Live erhält ein Gesicht für 97 Sprachen
Google ergänzt Gemini 3.8 Live um einen gestreamten Avatar mit Stimme, Mimik und Lippensynchronität in 97 Sprachen. Die Funktion ist in Gemini Enterprise verfügbar, eigene Avatare erfordern jedoch eine Freischaltung.
Lesen →News · 2026-09-24
Google baut zehnminütige KI-Videos aus Gedächtnis, Agenten und Feedback
Google stellte vier Forschungsframeworks vor, die lange Videos planen, Szenenzustände verfolgen und Prompts anhand visueller Kritik überarbeiten. Wichtiger als die zehnminütige Demo ist der Wechsel vom einzelnen Generator zu einem Produktionssystem mit Gedächtnis.
Lesen →News · 2026-07-13
Google macht Gemini zum Mentor für Indiens Technologielabore
Die meisten Versuche, KI in Schulen zu bringen, enden in isolierten Pilotprojekten. Google geht in Indien einen anderen Weg und nutzt die staatliche Laborinfrastruktur, in der Gemini die Rolle eines Expertenmentors übernimmt.
Lesen →News · 2026-09-23
Claude fand ein neues Enzymsystem, doch seine Funktion muss erst das Labor klären
Rund 950 Claude-Agenten durchsuchten 21 Stunden lang eine DNA-Datenbank und fanden ein bislang nicht charakterisiertes System namens ART mit Wiederholungen ähnlich einem CRISPR-Array. Anthropic bestätigte seine Bestandteile im Labor, doch die biologische Funktion ist weiterhin unbekannt.
Lesen →News · 2026-09-23
Entfernte GPUs helfen Robotern, doch das Netz bestimmt ihre Reflexe
Eine Microsoft-Studie zeigt, dass ausgelagerte Inference auf Edge- oder Cloud-GPUs Leistung und Akkulaufzeit von Robotern verbessert. Zugleich wird die harte Grenze sichtbar: Schon einige zehn Millisekunden Netzlatenz senken die Genauigkeit physischer Aufgaben.
Lesen →News · 2026-09-23
Gemini 3.8 macht aus TTS eine Regie für Stimmen
Google hat Gemini 3.8 Flash TTS und Flash-Lite TTS mit promptbasierter Stimmerzeugung, Regie für einzelne Zeilen und mehr als 100 Sprachen vorgestellt. Der entscheidende Schritt liegt in Kontrolle und Wiederholbarkeit, nicht nur in natürlicherem Klang.
Lesen →News · 2026-09-22
GPT-6 Astra halbiert Recherchezeit und Token-Kosten
OpenAI präsentierte eine Fallstudie des Startups Parallel, in der das neue Astra-Modell umfangreiche Recherchen in der halben Zeit abschloss. Für Unternehmen mit agentenbasierten Workflows bedeutet dies bis zu 50 % Einsparung bei Tokens für Aufgaben, die bisher mit roher Gewalt gelöst wurden.
Lesen →News · 2026-07-16
OpenAI verkauft Renndaten als Test für schnelle Entscheidungen
OpenAI zeigt in einem Video mit RaceTek Systems und Chip Ganassi Racing, wie Teams künstliche Intelligenz nutzen, um Streckendaten in schnellere Entscheidungen umzuwandeln. Die Quelle ist ein kurzer Beitrag auf X, was bedeutet, dass harte Zahlen fehlen und der wahre Wert eher im betrieblichen Muster als in einer bewiesenen Leistungskennzahl liegt.
Lesen →News · 2026-09-21
Das Chimera-Framework treibt die Arzneimittelforschung voran, indem es verschiedene KI-Modelle kombiniert
Microsoft Research und Novartis haben Chimera vorgestellt, ein Learning-to-Rank-System, das den Retrosynthese-Prozess in der Arzneimittelentwicklung verkürzt.
Lesen →