2026-10-06 · ← Aktualności
Astra zaliczyła tylko 55 % workflow kontraktowych. Właśnie dlatego test Ironclad jest ważny
OpenAI i Ironclad przygotowały 11 zadań z pracy prawnej, handlowej i zakupowej. GPT-6 Astra uzyskał w badaniu 55,0 %, wobec 41,6 % dla GPT-5.6 Sol, lecz ogłoszenie dotyczy badań, a nie gotowego produktu.
Nie udało się wczytać obrazu.
OpenAI i Ironclad zamieniły złożone procesy kontraktowe w 11 zadań badawczych. GPT-6 Astra uzyskał średnio 55,0 %, a GPT-5.6 Sol 41,6 %. Szacowany średni czas jednej próby spadł z 37,0 do 19,2 minuty.
Jedenaście zadań ocenia gotowy proces, a nie poprawne kliknięcia
Zadania obejmują pracę prawną, handlową i zakupową. Wśród nich są przygotowanie NDA, zbudowanie procesu akceptacji zakupów oraz zmiana wielokrotnie używanej klauzuli zgodnie z wybraną jurysdykcją. Według OpenAI doświadczony użytkownik potrzebowałby średnio 30 do 40 minut na jedno zadanie.
Każde zadanie oceniano według 8 do 50 kryteriów. Ironclad dostarczył hostowane środowiska testowe, a badacze przygotowali syntetyczne zadania treningowe i użyli reinforcement learning. Wewnętrzny model rozwojowy osiągnął 63,7 %, ale OpenAI nie łączy tego wyniku z dostępnym modelem.
Oprogramowanie enterprise staje się poligonem treningowym dla modeli
Ważniejszy od samej branży prawnej jest model współpracy. Dostawca software nie dodaje wyłącznie funkcji AI nad swoim API. Wnosi ekspertów domenowych, środowisko testowe i dokładną definicję sukcesu bezpośrednio do rozwoju frontier modelu.
Dla zespołów produktowych to sposób na przełożenie mglistego pomysłu na agenta na mierzalne zadanie. Samo wypełnienie formularza nie wystarczy. Agent musi zachować progi, akceptacje i wyjątki w całym procesie, a następnie sprawdzić, czy gotowy workflow działa dla różnych danych wejściowych.
Wynik 55 % oznacza postęp badawczy, a nie zgodę na samodzielną pracę
Porównanie obejmuje 11 zadań zaprojektowanych przez partnerów w hostowanym środowisku Ironclad. Astra działała z Max reasoning, a Sol z High reasoning, czyli z ustawieniami dającymi każdemu modelowi najlepszy wynik. Bez niezależnego zestawu, informacji o rozrzucie i wadze błędów liczby nie potwierdzają niezawodności produkcyjnej.
Ogłoszenie nie wprowadza też nowej publicznie dostępnej funkcji Ironclad. OpenAI wyraźnie podkreśla potrzebę nadzoru człowieka. W umowach jedna pominięta ścieżka akceptacji może ważyć więcej niż dziewięć prawidłowo wypełnionych pól.
Niezależne evals i audyt błędów zdecydują o wdrożeniu
Kolejnym istotnym sygnałem będą wyniki na nieznanych procesach, w powtarzanych próbach i po zmianie interfejsu. Firmy będą też potrzebowały rejestru działań, kontroli uprawnień, eskalacji niepewności oraz pomiaru ludzkich poprawek koniecznych po 19,2 minuty pracy agenta.
OpenAI szuka niewielkiej liczby kolejnych partnerów software, którzy dostarczą konkretne przypadki porażek, ekspertów, bezpieczne środowisko i dane do badań. Jeżeli ta współpraca stworzy przenośne evals, mogą one okazać się cenniejsze niż sam wynik Astry.
Werdykt Lilith
Astra ukończyła workflow kontraktowy w 19,2 minuty, lecz przy mecie zostawiła niemal połowę kryteriów. Prawnik może zdjąć rękę z myszy, ale jeszcze nie z odpowiedzialności.
Link zewnętrzny zostawiam na koniec. Najpierw krótkie wyjaśnienie tutaj, bez polowania po cudzej stronie.
Oryginalne źródło ↗ ↗