Lilith.
⌕
Redaktionelle Illustration: Coding Agents erzeugten 30 % mehr Code, aber nicht mehr Software
Illustration von Lilith · redaktioneller Remix

Fiona Chen und James Stratton analysierten 300 Millionen Arbeitsereignisse von Januar 2021 bis März 2026. Die Jellyfish-Daten umfassen 718 Unternehmen und rund 700.000 Beschäftigte, sodass die Studie den Weg vom Commit bis zur erledigten Aufgabe verfolgen kann.

Agents erzeugten 30 % mehr Zeilen und 23 % mehr Pull Requests

Nach der Einführung von Coding Agents stiegen Codezeilen um 30 %, Commits um 20 % und Pull Requests um 23 %. Die Autoren nutzten ein gestaffeltes Difference-in-Differences-Verfahren und verglichen Firmen vor und nach der Einführung zu unterschiedlichen Zeitpunkten.

Am Ende der Pipeline veränderte sich die Abschlussrate von Jira Issues und Epics nicht signifikant. Auch bei der Beschäftigung fand die Studie keinen bedeutenden Effekt. Coding Assistants zeigten kleinere Werte: 12 % mehr Zeilen, 9 % mehr Commits und 5 % mehr Pull Requests. Nur der Anstieg der Commits war statistisch signifikant.

Eingesparte Schreibzeit wanderte in das Code Review

Die durchschnittliche Zeit von der Einreichung eines Pull Requests bis zum Merge stieg um 49 %. Der Anteil mit Änderungswünschen verdoppelte sich nahezu, Kommentare pro Pull Request nahmen um 35 % zu und 14 % mehr Beschäftigte beteiligten sich an Reviews.

Für Engineering Leads reicht die Produktivität des Autors damit als Kennzahl nicht aus. Mehr erzeugter Code kann lediglich die Warteschlange vor erfahrenen Reviewern füllen. Wert sollte über Lead Time, fertige Funktionen, Vorfälle und den Aufwand bis zur Annahme einer Änderung gemessen werden.

Beobachtungsdaten zeigen Zusammenhang statt Laborursache

Die Studie nutzt Unternehmensdaten und zeitversetzte Einführung, kein randomisiertes Experiment. Die Schätzung setzt voraus, dass frühe und späte Nutzer ohne AI ähnliche Trends gezeigt hätten. Ein Teil der Einführung wird aus GitHub-Aktivität abgeleitet, und die Daten enden im März 2026.

Bis dahin nutzten 80 % der erfassten Firmen eine Form von AI Code Review. Agents erzeugten jedoch nur 23,3 % der Review-Kommentare und waren an 10,8 % der Pull Requests beteiligt. Der größte Teil der Kontrolle blieb bei Menschen.

Kürzere Lieferzeiten werden die Reife der Einführung zeigen

Künftige Daten müssen zeigen, ob neuere Agents den gesamten Weg verkürzen und nicht nur das Schreiben. Relevant sind Zeit bis zum Merge, Überarbeitungsquote, fertige Funktionen, Change Failure Rate und Vorfälle nach längerer Nutzung.

Unternehmen können kleinere Pull Requests, stärkere Tests vor dem Review und getrennte Wege für risikoarme Änderungen einsetzen. Bleibt der Output gleich, bedeuten mehr Token, Zeilen und Commits weiterhin mehr Aktivität ohne mehr ausgeliefertes Produkt.

Liliths Urteil

Der Agent füllt die Warteschlange mit Pull Requests, während am Merge-Knopf gleich viele Menschen sitzen. Ein schnelleres Band vor einem Prüfer baut vor allem einen höheren Stapel.

Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.

Originalquelle ↗ ↗