Wie viel Arbeit übernehmen KI-Agenten tatsächlich – und wo endet ihr Einfluss? Ein Forschungsteam hat dazu 769 Aufgaben-Protokolle aus der Entwicklung eines eigenen KI-Modells ausgewertet. Als Agenten gelten dabei Systeme, die nicht nur einzelne Antworten liefern, sondern Aufgaben über mehrere Schritte hinweg selbstständig bearbeiten.

Das Ergebnis lässt sich in zwei Zahlen fassen. Bis zu 55 Prozent der Methodenvorschläge stammten von KI-Agenten. Gleichzeitig trafen Menschen über 85 Prozent der Endentscheidungen. Die Systeme waren also stark an der Vorbereitung beteiligt, kaum aber an der Festlegung.

Mehr Aktivität ist nicht mehr Autonomie

Genau vor dieser Verwechslung warnen die Autorinnen und Autoren der Untersuchung: Eine steigende Zahl von Agenten-Beiträgen bedeutet nicht automatisch, dass die Systeme eigenständiger handeln. Wer die Menge an generierten Vorschlägen als Maß für Autonomie liest, überschätzt den tatsächlichen Reifegrad.

Für die Praxis ist diese Unterscheidung mehr als eine begriffliche Feinheit. Sie entscheidet darüber, wie Sie Verantwortlichkeiten in Projekten festlegen, welche Freigabeschritte Sie einplanen und wie Sie den Nutzen von KI-Werkzeugen im Reporting darstellen.

Der übersehene Effekt: Aufgaben, die sonst liegen bleiben

Ein weiterer Befund verdient Aufmerksamkeit: Rund ein Drittel der ausgewerteten Aufgaben wäre ohne KI gar nicht erst angegangen worden. Der Gewinn liegt hier also nicht darin, dass bestehende Arbeit schneller erledigt wird, sondern darin, dass zusätzliche Arbeit überhaupt stattfindet.

Das sind typischerweise Dinge, die im Alltag hinten anstehen: das Durchspielen einer alternativen Umsetzungsvariante, das Prüfen einer Randbedingung, das Aufbereiten einer Datenlage, für die sonst schlicht keine Zeit bleibt. Solche Aufgaben tauchen in klassischen Effizienzrechnungen nicht auf, weil es keinen Vorher-Wert gibt, mit dem man vergleichen könnte.

Was das für die Bewertung von KI-Einsatz heißt

Viele Wirtschaftlichkeitsbetrachtungen zu KI im Entwicklungsumfeld fragen nach eingesparten Stunden. Die Auswertung legt nahe, dass diese Perspektive zu eng ist. Sinnvoller sind mehrere Blickwinkel nebeneinander:

  • Vorbereitungsleistung: Wie viele belastbare Optionen liegen vor einer Entscheidung auf dem Tisch – und wie schnell?
  • Zusätzliche Abdeckung: Welche Prüfungen, Varianten oder Analysen finden jetzt statt, die vorher entfallen sind?
  • Entscheidungsqualität: Werden Festlegungen auf besserer Grundlage getroffen, auch wenn sie weiterhin von Menschen kommen?

Die reine Anzahl der Agenten-Läufe ist dagegen eine schwache Kennzahl. Sie sagt wenig darüber aus, ob die erzeugten Vorschläge verwertbar waren.

Konsequenzen für die Prozessgestaltung

Wenn Menschen die überwiegende Mehrheit der Entscheidungen treffen, muss der Prozess darauf ausgelegt sein – und nicht auf ein Szenario vollständiger Selbststeuerung. Daraus ergeben sich einige praktische Punkte:

  1. Entscheidungspunkte benennen. Legen Sie fest, an welchen Stellen eine menschliche Freigabe zwingend ist, etwa bei Architekturfragen, Datenschutzthemen oder Änderungen an produktiven Systemen.
  2. Vorschläge vergleichbar machen. Agenten liefern Optionen. Damit daraus schnelle Entscheidungen werden, brauchen die Vorschläge eine einheitliche Form: Annahmen, Aufwand, Risiken.
  3. Nachvollziehbarkeit sichern. Protokolle darüber, welcher Vorschlag von wem kam und wer entschieden hat, sind keine Bürokratie, sondern die Grundlage für spätere Auswertungen – so wie in der beschriebenen Untersuchung.
  4. Erwartungen im Team kalibrieren. Wer ein autonomes System erwartet, ist enttäuscht. Wer einen sehr produktiven Zuarbeiter erwartet, arbeitet realistisch.

Einordnung mit gebotener Vorsicht

Die Zahlen stammen aus der Entwicklung eines KI-Modells, also aus einem forschungsnahen Umfeld mit sehr spezifischen Aufgaben. Sie lassen sich nicht eins zu eins auf ein TYPO3-Relaunch-Projekt oder auf die Wartung einer Fachanwendung übertragen. Die Grundstruktur – viel Zuarbeit, wenig eigenständige Entscheidung – deckt sich aber mit dem, was in der täglichen Projektarbeit beobachtbar ist.

Bemerkenswert ist zudem, dass der Befund aus einem Umfeld kommt, in dem der Umgang mit KI-Werkzeugen zum Kerngeschäft gehört. Wenn dort die Entscheidungshoheit weitgehend bei Menschen bleibt, ist es unwahrscheinlich, dass sie in weniger spezialisierten Kontexten schneller abwandert.

Was das für Web- und Softwareprojekte heißt

Planen Sie KI-Agenten als Kapazitätserweiterung in der Vorbereitung ein, nicht als Ersatz für Rollen mit Entscheidungsbefugnis: Reviews, Freigaben und fachliche Verantwortung bleiben besetzt. Der greifbarste Nutzen liegt oft in den Aufgaben, die ohne Werkzeugunterstützung schlicht nicht erledigt würden – etwa zusätzliche Tests, Migrationsvarianten oder Analysen im Bestand. Wer den Erfolg von KI-Einsatz messen will, sollte deshalb nicht nur auf gesparte Stunden schauen, sondern auf die Qualität der Entscheidungsgrundlagen.

Quellen