Lilith.
⌕
Redaktionelle Illustration: Astra erreichte bei Vertrags-Workflows nur 55 %. Genau deshalb ist Ironclads Test wichtig
Illustration von Lilith · redaktioneller Remix

OpenAI und Ironclad haben komplexe Vertragsprozesse in 11 Forschungsaufgaben überführt. GPT-6 Astra erzielte im Mittel 55,0 %, GPT-5.6 Sol kam auf 41,6 %. Die geschätzte durchschnittliche Zeit pro Versuch sank von 37,0 auf 19,2 Minuten.

Elf Aufgaben bewerten den fertigen Prozess statt korrekter Klicks

Die Aufgaben stammen aus Recht, Vertrieb und Beschaffung. Dazu gehören das Einrichten einer Geheimhaltungsvereinbarung, ein Genehmigungsprozess für Einkäufe und die Anpassung einer wiederverwendbaren Vertragsklausel an eine gewählte Rechtsordnung. OpenAI schätzt den Aufwand für erfahrene Nutzer auf durchschnittlich 30 bis 40 Minuten je Aufgabe.

Jede Aufgabe wurde anhand von 8 bis 50 Kriterien bewertet. Ironclad stellte gehostete Testumgebungen bereit, die Forscher erzeugten synthetische Trainingsaufgaben und nutzten Reinforcement Learning. Ein internes Entwicklungsmodell erreichte 63,7 %, doch OpenAI ordnet dieses Ergebnis keinem verfügbaren Modell zu.

Unternehmenssoftware wird zum Trainingsgelände für Frontier-Modelle

Das Kooperationsmodell ist wichtiger als die Rechtsbranche allein. Ein Softwareanbieter setzt nicht bloß eine AI-Funktion auf seine API. Er bringt Fachleute, Testumgebung und genaue Erfolgskriterien direkt in die Entwicklung des Frontier-Modells ein.

Für Produktteams ist das eine Methode, aus einem vagen Agentenwunsch eine messbare Aufgabe zu machen. Ein ausgefülltes Formular genügt nicht. Der Agent muss Grenzwerte, Freigaben und Ausnahmen über den gesamten Workflow erhalten und anschließend prüfen, ob der Prozess bei verschiedenen Eingaben funktioniert.

55 % sind Forschungsfortschritt und keine Erlaubnis zum Alleingang

Der Vergleich basiert auf 11 von den Partnern entworfenen Aufgaben in Ironclads gehosteter Umgebung. Astra lief mit Max Reasoning und Sol mit High Reasoning, jeweils mit der Einstellung für das beste Ergebnis. Ohne unabhängigen Datensatz, Streuung und Angaben zur Schwere der Fehler belegen die Zahlen keine Produktionsreife.

Die Ankündigung führt auch keine neue öffentlich verfügbare Ironclad-Funktion ein. OpenAI betont ausdrücklich die menschliche Aufsicht. Bei Verträgen kann ein fehlender Genehmigungszweig schwerer wiegen als neun korrekt ausgefüllte Felder.

Unabhängige Evals und Fehleraudits entscheiden über den Einsatz

Das nächste brauchbare Signal sind Ergebnisse mit unbekannten Prozessen, wiederholten Läufen und geänderter Oberfläche. Unternehmen brauchen außerdem Aktionsprotokolle, Berechtigungskontrollen, Eskalation bei Unsicherheit und eine Messung der menschlichen Korrekturen nach dem 19,2-minütigen Versuch des Agenten.

OpenAI sucht eine kleine Zahl weiterer Softwarepartner mit konkreten Fehlerfällen, Fachleuten, sicherer Testumgebung und nutzbaren Daten. Entstehen daraus übertragbare Evals, könnten sie wichtiger werden als Astras Punktzahl selbst.

Liliths Urteil

Astra beendete den Vertrags-Workflow in 19,2 Minuten, ließ aber fast die Hälfte der Kriterien an der Ziellinie liegen. Juristen können die Hand von der Maus nehmen, nicht von der Verantwortung.

Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.

Originalquelle ↗ ↗