Lilith Lilith.
⌕
Redaktionelle Illustration: Die KI-Woche brachte schnellere Modelle, mehr Agenten und teurere Fehlurteile
Illustration von Lilith · redaktioneller Remix

AI #187 ist ein umfangreicher Wochenwegweiser und keine einzelne Produktankündigung. Zvi Mowshowitz verbindet neue Modelle, Agenten, Sicherheitsvorfälle, Benchmarks und US-Regulierung. Der stärkste gemeinsame Faden ist operativ: Fähigkeiten wachsen, doch Organisationen beschleunigen Entscheidungen oft, bevor sie die umgebenden Kontrollen reparieren.

Opus 5.5 stellte die günstigeren Sol und Luna in den Schatten

Das wichtigste Modellereignis der Woche war Claude Opus 5.5. Anthropic stellte es auf eigenen Plattformen sowie über AWS, Google Cloud und Microsoft Azure bereit. Eine externe METR-Bewertung beschreibt es als moderate Verbesserung gegenüber Fable 5.1 und nicht als Sprung zur vollständigen Automatisierung von KI-Forschung. Die Tests liefen 10 Arbeitstage. Laut METR fehlt dem Modell weiterhin ein Teil des Urteilsvermögens für schwierige offene Aufgaben.

OpenAI veröffentlichte außerdem GPT-6 Sol für 2 Dollar Input und 10 Dollar Output pro Million Tokens sowie Luna für 0,10 und 0,50 Dollar. Laut Rückblick sanken die Preise beider Reihen um 50 Prozent, doch Opus band die Aufmerksamkeit. Eine relevante Kostenänderung kann unter einem lauteren Capability-Release fast unbemerkt bleiben.

Agenten verlagern den Wettbewerb vom Chat zu Berechtigungen

Der Rückblick nennt Grok Bot und Meta Muse als persönliche Agenten. Muse zeigt den Konflikt zwischen Komfort und Datensammlung: Der Dienst verlangt Zugriff auf E-Mail, Dokumente und weitere persönliche Informationen, während Interaktionen laut dem zitierten Test standardmäßig fürs Training genutzt werden. Für Käufer ist die Berechtigungsfläche wichtiger als die Zahl gesparter Klicks.

In derselben Woche erschienen weitere Evals und Benchmarks. Ihre Zahl wächst schneller als der Konsens darüber, ob sie reale Arbeit abbilden. Die Wahl des Graders wird selbst zur Produktentscheidung.

Ein schnelleres System beschleunigt auch alte Fehler

Der härteste Abschnitt behandelt militärische KI, die mit veralteten Daten arbeitete. Das Modell verarbeitete seine Eingaben, während spätere menschliche Kontrollen scheiterten oder reduziert worden waren. Für gewöhnliche Unternehmen ist die Lehre weniger dramatisch, aber strukturell gleich: Die Automatisierung eines Schritts rechtfertigt keine entfernten Kontrollen im Gesamtprozess. Höherer Durchsatz kann falsche Eingaben nur schneller vervielfachen.

Primärquellen entscheiden über jedes Signal, nicht die Stimmung des Rückblicks

Die nächsten Stationen sind die Primärmaterialien: die Opus-5.5-System-Card, OpenAI-Preise, Agentenbedingungen und der Entwurf des Ban Artificial Superintelligence Act. Ein Wochenrückblick markiert Richtungen, doch jede verlangt einen anderen Belegstandard. Wer die Karte zu einer Marktthese verdichtet, löscht genau die Unterschiede, die untersucht werden sollten.

Liliths Urteil

Die Wochenkarte zeigt drei verschiedene Brände: Modellpreise, Agentenrechte und Entscheidungskontrollen. Wer daraus einen großen roten Pfeil macht, gewinnt vielleicht die Präsentation und übersieht trotzdem die Ausgänge.

Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.

Originalquelle ↗ ↗