KI-Coding-Agenten erzeugen mehr Code, aber nicht mehr Software
Die Harvard-Forscher Fiona Chen und James Stratton werteten Jellyfish-Daten aus: 300 Millionen Arbeitsereignisse, über 700 Firmen. Der Gewinn beim Programmieren wird vom Code-Review aufgezehrt; Output und Beschäftigung ändern sich kaum.
Seit Jahren geht die Branche von einer einfachen Annahme aus: Wenn KI-Coding-Assistenten und -Agenten Code schneller schreiben, müsste der Software-Output im gleichen Maß steigen, und Unternehmen könnten sogar weniger Entwickler beschäftigen. Eine neue Studie, über die Ars Technica berichtet, stellt diese Annahme infrage. Die Harvard-Forscher Fiona Chen und James Stratton haben reale Engineering-Daten von Hunderten Firmen untersucht. Ihr Ergebnis: Es gibt kaum Belege dafür, dass Unternehmen, die diese Werkzeuge einführen, mehr Software ausliefern oder weniger Personal benötigen. Code ist günstiger zu erzeugen. Ausgelieferte Software ist es nicht.
Die empirische Grundlage der Studie ist breit. Die Autoren nutzten aggregierte Analysedaten von Jellyfish, einem Unternehmen, das die detaillierte Arbeitsleistung von Entwicklerteams misst. Sie umfassen rund 300 Millionen einzelne Arbeitsereignisse, etwa Commits und Pull Requests, sowie Daten aus Ticketsystemen. Erfasst sind mehr als 700.000 Beschäftigte in über 700 Softwareunternehmen, von 2021 bis März 2026. Um zu bestimmen, wann eine Firma KI einführte, kombinierten die Forscher direkt gemessene KI-Nutzung mit einer Analyse der GitHub-Aktivität. Sie unterscheiden zudem zwei Produktarten: KI-Assistenten, die Code vervollständigen, der überwiegend von Menschen stammt, und KI-Agenten, die auf Basis von Prompts weitgehend selbstständig Code schreiben und einreichen. Anschließend führten sie eine Differenz-von-Differenzen-Regression für zentrale Variablen vor und nach der Einführung durch. Dieses Design ist wichtig. Es trennt allgemeine Zeittrends und feste Unterschiede zwischen Firmen von der Wirkung der Werkzeuge und liegt damit näher an einer kausalen Deutung als ein einfacher Vergleich von Nutzern und Nichtnutzern.
Der wertvollste Teil der Arbeit ist die Erklärung. Nach Aussage der Autoren wird jeder Effizienzgewinn in der Programmierphase von nachgelagerten Engpässen im Produktionsprozess aufgezehrt. Der größte davon ist das Code-Review durch Menschen. Nach der Einführung dauert der Review-Prozess deutlich länger, Pull Requests müssen häufiger überarbeitet werden, und Reviewer hinterlassen mehr Kommentare. Jeder Entwickler kennt dieses Muster. KI-Code wirkt oft plausibel und läuft oft auch, doch niemand kann ihm ohne Prüfung vertrauen. Der Aufwand, die Korrektheit festzustellen, wandert daher vom Autor zum Reviewer. Wenn eine Stufe einer Kette schneller wird und die Nachbarstufe nicht, bestimmt die langsamste Stufe den Gesamtdurchsatz. Das ist die alte Logik der Engpasstheorie, nur mit einer Verschiebung: Der Engpass ist jetzt das Lesen, nicht das Schreiben.
Für die Branche ergeben sich daraus mehrere Lehren. Erstens können Kennzahlen wie erzeugte Codezeilen, Commit-Zahlen oder Tool-Akzeptanz in die Irre führen. Sie liegen genau auf der Seite des Prozesses, die die Werkzeuge verstärken, und sehen daher beeindruckend aus, auch wenn sich die Auslieferung nicht ändert. Zweitens reicht es für einen echten Produktivitätsgewinn nicht aus, einen stärkeren Generator einzukaufen. Unternehmen müssen auch in die Review-Stufe investieren: bessere automatisierte Tests, statische Analyse, durchsetzbare Konventionen und Agenten, die beim Prüfen helfen, statt nur zu erzeugen. Drittens findet die Erzählung, KI erlaube kleinere Entwicklerteams, in diesen Daten keine Stütze. Im Untersuchungszeitraum zeigt sich kein klarer Rückgang der Beschäftigung. Die Reichweite dieser Aussage sollte man benennen. Die Studie sagt nicht, dass KI keinen Nutzen bringt. Sie sagt, dass sich die Kennzahlen für Output und Personalstärke auf Firmenebene kaum ändern. Das ist etwas anderes als die Behauptung, einzelne Aufgaben würden nicht schneller.
Auch diese Arbeit hat Grenzen. Die Daten enden im März 2026, während sich Modellfähigkeiten, Agentendesign und Arbeitsabläufe rasch ändern. Der Review-Engpass muss nicht dauerhaft sein. Wenn künftige Agenten kleinere, leichter prüfbare Änderungen liefern oder Tests und Belege beifügen, die Reviewer schnell kontrollieren können, könnten die Review-Kosten sinken. Zudem ist Software-Output schwer zu messen, und Commits sowie Pull Requests sind nur Stellvertreter für den Wert, der bei den Nutzern ankommt. Die Botschaft bleibt dennoch klar. Im Zeitalter der Agenten ist nicht mehr das Erzeugen von Code die knappe Fähigkeit, sondern die Bestätigung seiner Korrektheit zu vertretbaren Kosten. Teams und Werkzeuge, die Verifikation schneller und verlässlicher machen, haben die besten Chancen, aus mehr Code auch mehr Software zu machen.
Sources
FAQ
Was ist das Hauptergebnis der Studie?
Die Harvard-Forscher Fiona Chen und James Stratton fanden kaum Belege, dass Firmen mit KI-Coding-Assistenten oder -Agenten mehr Software ausliefern oder weniger Personal einsetzen. Die Gewinne beim Programmieren werden von nachgelagerten Engpässen aufgezehrt, vor allem vom Code-Review.
Warum wird das Code-Review zum Engpass?
Nach der KI-Einführung dauert das Review deutlich länger, Pull Requests brauchen häufiger Überarbeitungen und Reviewer schreiben mehr Kommentare. KI-Code kann man nicht ungeprüft vertrauen, daher wandert der Prüfaufwand vom Autor zum Reviewer.
Wie belastbar sind Daten und Methode?
Die Jellyfish-Daten umfassen rund 300 Millionen Arbeitsereignisse, über 700 Firmen und 700.000 Beschäftigte, von 2021 bis März 2026. Die Methode ist eine Differenz-von-Differenzen-Regression. Grenzen: Die Daten enden im März 2026, und Commits sind nur Stellvertreter für den Output.