METR-Studie: Gefühlte +20 %, gemessene -19 % – die 39-Prozentpunkte-Lücke
Gefühlte +20 %, gemessene -19 %: METR-Studie entlarvt KI-Produktivitätsillusion
Mit KI erstelltInhalt
◆ Fakten auf einen Blick
- METR veröffentlichte eine frühere Studie, wonach der Einsatz von KI-Tools bei erfahrenen Open-Source-Entwicklern zu einer Verlangsamung von 20 % (bzw. 19 % längere Bearbeitungszeit) führte; Daten aus Februar bis Juni 2025.
- In der METR-Studie von 2025 wurden 16 erfahrene Entwickler, 246 Aufgaben, Repositories mit über 22.000 Sternen und über einer Million Codezeilen verwendet; die Aufgaben wurden randomisiert mit/ohne KI bearbeitet.
- Vor der Studie sagten die Entwickler eine Beschleunigung von 24 % voraus; nach der Studie gaben sie an, sich 20 % schneller zu fühlen; die Messung ergab jedoch eine Verlangsamung von 19 %.
- Die Lücke zwischen gefühlter und gemessener Geschwindigkeit beträgt 39 Prozentpunkte.
- METR startete im August 2025 eine neue, größere Studie mit aktuellen KI-Tools, hält deren Daten aber wegen Selektionseffekten für unzuverlässig: Entwickler, die nicht ohne KI arbeiten wollten, nahmen nicht teil; der Stundenlohn wurde von 150 auf 50 Dollar gesenkt; Zeitmessungen bei paralleler Nutzung mehrerer KI-Agenten sind unzuverlässig.
- Frühere kontrollierte Studie mit GitHub Copilot: Behandlungsgruppe erledigte Aufgabe 55,8 % schneller als Kontrollgruppe.
Gefühlte +20 %, gemessene -19 %: METR-Studie entlarvt KI-Produktivitätsillusion
Eine Studie der Forschungsgruppe METR zeigt, dass erfahrene Open-Source-Entwickler ihre Beschleunigung durch KI-Tools beim Programmieren deutlich überschätzen. Vor Beginn der Untersuchung sagten die 16 Teilnehmer eine Beschleunigung von 24 Prozent voraus. Nach der Bearbeitung von 246 realen Aufgaben gaben sie an, sich 20 Prozent schneller zu fühlen. Die tatsächliche Messung anhand von Bildschirmaufzeichnungen und Zeitstempeln ergab jedoch das Gegenteil: Die Aufgaben dauerten mit KI-Unterstützung 19 Prozent länger als ohne. Die Lücke zwischen gefühlter und gemessener Geschwindigkeit beträgt damit 39 Prozentpunkte. Die Studie wurde mit Daten aus Februar bis Juni 2025 durchgeführt und ist ein randomisiertes kontrolliertes Experiment. Die Diskrepanz ist kein Rundungsfehler, sondern ein systematischer Wahrnehmungsfehler: Entwickler erleben die KI-gestützte Arbeit als schneller, obwohl sie objektiv langsamer ist. METR selbst veröffentlichte die Ergebnisse, obwohl sie gegen die Intuition sprechen. Die Zahlen im Überblick: vorhergesagte Beschleunigung plus 24 Prozent, gefühlte Beschleunigung plus 20 Prozent, gemessene Verlangsamung minus 19 Prozent. Die Differenz von 39 Prozentpunkten ist die Kluft zwischen subjektiver Wahrnehmung und objektiver Messung.
Die 39-Prozentpunkte-Lücke: Wahrnehmungsfehler statt echter Geschwindigkeitsdifferenz
Die 39 Prozentpunkte sind nicht der tatsächliche Effekt von KI auf die Arbeitsgeschwindigkeit, sondern die Differenz zwischen der gefühlten Beschleunigung von plus 20 Prozent und der gemessenen Verlangsamung von minus 19 Prozent. Ein Artikel auf Towards AI verwechselt diese Wahrnehmungslücke mit einer echten Geschwindigkeitsdifferenz und suggeriert, KI mache Entwickler um 39 Prozent langsamer. Das ist falsch. Die METR-Primärquelle gibt als gemessenen Effekt lediglich eine Verlangsamung von 19 Prozent (beziehungsweise 20 Prozent) an. Die 39 Prozentpunkte beschreiben ausschließlich den Abstand zwischen subjektiver Einschätzung und objektiver Messung. Wer sie als Produktivitätseffekt interpretiert, verdoppelt den tatsächlichen Wert und verkennt den eigentlichen Befund: Die Wahrnehmung der Entwickler weicht stark von der Realität ab. Diese Unterscheidung ist zentral, denn sie betrifft die Frage, ob KI-Tools die Arbeit beschleunigen oder verlangsamen. Die Studie zeigt eine Verlangsamung, aber keine 39-prozentige.
Methodik der METR-Studie: 16 Experten, 246 Aufgaben, über eine Million Codezeilen
Das Design der METR-Studie unterstreicht die Belastbarkeit der Messung. 16 erfahrene Entwickler bearbeiteten 246 Aufgaben aus Repositories, die im Durchschnitt mehr als 22.000 GitHub-Sterne und über eine Million Codezeilen aufwiesen. Die Teilnehmer hatten über Jahre zu diesen Codebasen beigetragen. Die Aufgaben wurden randomisiert mit und ohne KI-Unterstützung bearbeitet, sodass keine Verzerrung durch die Aufgabenauswahl entstand. Als KI-Werkzeug kam Cursor Pro mit den Modellen Claude 3.5 und Claude 3.7 Sonnet zum Einsatz. Die Kombination aus realen, großen Codebasen, erfahrenen Entwicklern und zufälliger Zuteilung macht die Ergebnisse aussagekräftig. Allerdings ist die Stichprobe mit 16 Personen klein, und die Entwickler kannten die Repositories bereits sehr gut – ein Szenario, in dem KI-Assistenten weniger Kontext liefern können als bei unbekanntem Code. Diese Einschränkungen schmälern nicht die Validität der Messung, relativieren aber die Übertragbarkeit auf andere Arbeitsumgebungen.
Folgestudie ab August 2025: METR selbst warnt vor unzuverlässigen Daten
Im August 2025 startete METR eine größere Folgestudie mit 57 Entwicklern, 143 Repositories und über 800 Aufgaben. Die Organisation selbst stuft die dabei erhobenen Daten jedoch als unzuverlässig ein. Der Hauptgrund: Viele Entwickler, die nicht ohne KI arbeiten wollten, nahmen gar nicht erst teil. Dieser Selektionseffekt verzerrt die Schätzung des KI-bedingten Tempozuwachses nach unten. Zusätzlich wurde der Stundenlohn von 150 auf 50 Dollar gesenkt, was weitere Auswahlverzerrungen verursachte. Auch die Zeitmessung ist bei Teilnehmern, die mehrere KI-Agenten parallel nutzen, nicht mehr zuverlässig. Die Rohdaten zeigen zwar Hinweise auf eine Beschleunigung, doch die methodischen Probleme verhindern eine belastbare Aussage.
Widersprüchliche Befunde: Copilot +55,8 %, Google +21 %, DeputyDev +31,8 %
Andere kontrollierte Studien kommen zu positiven Effekten, sind aber kaum vergleichbar. Ein Experiment mit GitHub Copilot ergab, dass die Behandlungsgruppe eine Aufgabe 55,8 Prozent schneller erledigte als die Kontrollgruppe. Eine randomisierte kontrollierte Studie bei Google mit 96 Vollzeit-Softwareingenieuren schätzte die Zeitersparnis durch drei KI-Features auf etwa 21 Prozent, allerdings mit großem Konfidenzintervall. Eine Unternehmensstudie zur Plattform DeputyDev berichtet von einer Reduktion der PR-Review-Zykluszeit um 31,8 Prozent. Demgegenüber fand eine Längsschnitt-Fallstudie bei NAV IT keine statistisch signifikanten Änderungen der Commit-Aktivität nach der Einführung von Copilot, obwohl die subjektive Produktivitätswahrnehmung abwich. Die Unterschiede erklären sich durch verschiedene Stichproben, Aufgabentypen, Tools, Erfahrungsgrade und Messgrößen. Die METR-Studie untersuchte erfahrene Open-Source-Entwickler in vertrauten Repositories mit Cursor und Claude; die Copilot-Studie rekrutierte Entwickler für eine isolierte Programmieraufgabe. Die positiven Ergebnisse stammen teils aus Laborumgebungen oder spezifischen Unternehmenskontexten, während METR reale Open-Source-Arbeit maß. Solche Differenzen machen direkte Vergleiche der Prozentwerte irreführend. METR selbst warnt vor Verallgemeinerungen.
Warum die Wahrnehmung trügt: Konsequenzen für Entwickler und Unternehmen
Die Diskrepanz zwischen Gefühl und Messung hat praktische Konsequenzen. Entwickler, die sich durch KI schneller fühlen, überschätzen ihre tatsächliche Produktivität. Unternehmen, die auf Basis solcher Selbsteinschätzungen planen, riskieren Fehlkalkulationen bei Zeitplänen und Ressourcen. Die METR-Studie zeigt, dass subjektive Eindrücke kein verlässlicher Indikator für reale Effekte sind. Hinzu kommen verwandte Risiken: KI-generierte Commits leaken Secrets doppelt so häufig wie menschliche, und der Zugriff auf KI-Assistenten lässt die Antwort „Ich weiß nicht“ bei Entwicklern fast verschwinden. Beides deutet darauf hin, dass der unkritische Einsatz von KI-Tools nicht nur die Geschwindigkeit, sondern auch die Qualität und Sicherheit beeinträchtigen kann. Belastbare Messungen statt gefühlter Effekte sind daher unerlässlich, um den tatsächlichen Nutzen von KI in der Softwareentwicklung zu bewerten.



