Es gibt in der Debatte über Künstliche Intelligenz und Führung einen Satz, der unbequemer ist als die meisten Heilsversprechen: Eine durchschnittliche KI gibt einer Führungskraft heute womöglich präziseres Feedback zur eigenen Kommunikation, als eine durchschnittliche Führungskraft es ihren Mitarbeitenden gibt.
Der Satz überhöht keine Technologie. Sein Reiz liegt woanders: Er verschiebt die Frage. Die verbreitete Frage lautet, ob KI Führungskräfte ersetzt. Die Antwort ist unspektakulär — nein. Die produktivere Frage lautet: Welche Anteile heutiger Führungsarbeit erfordern tatsächlich menschliche Urteilskraft, und welche sind wiederholbare Muster, die bislang schlicht niemand systematisch beobachtet hat?
Was KI wirklich sichtbar macht
Katharina Lange und José Parra Moyano vom IMD Lausanne entwickelten ein sprachmodellgestütztes Werkzeug und erprobten es mit 167 Führungskräften aus verschiedenen Branchen und Ländern. Der Aufbau war bewusst schlicht: Führungskräfte coachten einander in realen beruflichen Situationen, während das Werkzeug zuhörte. Anschließend baten sie um eine Einschätzung — welchen Stil habe ich verwendet, welche Muster wiederholen sich, was erkennst du, das ich selbst nicht sehe?
Dass ein Sprachmodell Gesprächsstrukturen klassifizieren kann, überrascht wenig. Auffällig war die Größe der Lücke. Rund fünfundfünfzig Prozent der Rückmeldungen fielen in eine Lernzone, in der das Feedback zugleich unerwartet und nützlich war: Es forderte Annahmen heraus und legte blinde Flecken offen. Bei etwa zehn Prozent der beteiligten Führungskräfte trat dagegen eine Irritationszone auf — meist dann, wenn die Rückmeldung dem Selbstbild widersprach.
Die beiden Werte gehören nicht zu einer gemeinsamen Verteilung: Der erste bezieht sich auf Rückmeldungen, der zweite auf Personen. Die Autoren selbst führen sie uneinheitlich, weshalb sie hier getrennt stehen.
Diese Zahlen sollte man nüchtern betrachten. Sie stammen aus einem einzelnen Werkzeugtest mit Selbstauskunft, nicht aus einem kontrollierten Experiment: Es gibt keine Kontrollgruppe, keinen veröffentlichten Methodenteil und keine begutachtete Fassung. Ein Modell ist nur so gut wie seine Daten, es kann halluzinieren, und kulturelle Feinheiten oder unausgesprochene Signale erfasst es unzureichend. Das Fazit der Autoren ist ausdrücklich: KI ist eine Ergänzung menschlicher Expertise, kein Ersatz.
Ein altes Problem, neu vermessen
Die Führungsforschung kannte den Befund lange vor den Sprachmodellen. Seit den Arbeiten von Leanne Atwater und Francis Yammarino gilt die Selbst-Fremd-Übereinstimmung als etablierter Indikator für Führungswirkung. Der robusteste Befund über viele Studien hinweg: Wer sich systematisch überschätzt, wird als weniger wirksam eingeschätzt — und reagiert zugleich schwächer auf Entwicklungsfeedback.
Führung war lange ein Feld, in dem Selbstbild, Fremdbild und tatsächliche Wirkung schwer auseinanderzuhalten waren. Nicht aus Unfähigkeit, sondern weil verlässliches, häufiges, unverstelltes Feedback teuer und selten ist. Was Sprachmodelle verändern, ist nicht die Erkenntnis, dass die Lücke existiert. Es ist der Preis, zu dem sie beobachtbar wird.
Führung verschiebt sich damit von einer Eigenschaft, die man einer Person zuschreibt, zu einem beobachtbaren Verhalten im System. Die entscheidende Frage lautet nicht mehr: Wie habe ich es gemeint? Sondern: Welche Wirkung hat mein Verhalten erzeugt?
Warum der Spiegel angenommen wird — und wo nicht
Die Forschung kennt zwei Muster, die in verschiedene Richtungen weisen. Logg, Minson und Moore beschrieben in sechs Experimenten mit rund 1900 Teilnehmenden die algorithm appreciation: Menschen folgen einem Rat eher, wenn sie ihn für algorithmisch halten, als wenn sie ihn einem Menschen zuschreiben. Warum das so ist, weist die Arbeit nicht nach. Naheliegend ist, dass ein Modell nicht zu urteilen scheint und keine soziale Beziehung belastet — wer einer Maschine zuhört, muss kein Gesicht wahren. Das ist allerdings eine Deutung, kein Befund.
Für Führungskräfte ist ein zweites Ergebnis derselben Arbeit das interessantere: Erfahrene Fachleute, die regelmäßig Prognosen stellen, folgten algorithmischem Rat seltener als Laien — zu Lasten ihrer eigenen Treffgenauigkeit. Wer viel Erfahrung hat, hört also schlechter zu, gerade dort, wo Zuhören etwas gebracht hätte.
Dem steht ein gegenläufiger Befund gegenüber. Dietvorst, Simmons und Massey zeigten in fünf Studien mit rund 2500 Teilnehmenden die algorithm aversion: Sehen Menschen einen Algorithmus einen Fehler machen, wenden sie sich schneller und deutlicher ab, als sie es bei einem Menschen täten. Dass die Ablehnung bei Aufgaben stärker ausfällt, die als subjektiv oder wertbehaftet gelten — also genau im Terrain der Führung —, zeigt eine dritte Arbeit von Castelo, Bos und Lehmann.
Die Befunde widersprechen einander nicht. Sie beschreiben verschiedene Bedingungen: Solange kein Fehler sichtbar wird, überwiegt die Bereitschaft, dem Modell zu folgen; danach kippt sie.
Daraus folgt eine unbequeme Ambivalenz: Dieselbe Führungskraft, die das Feedback in der Lernzone dankbar aufnimmt, kann es in der Irritationszone reflexhaft entwerten. Und dieselbe scheinbare Objektivität, die Vertrauen schafft, kann zur neuen Form der Verantwortungsdiffusion werden. Formulierungen wie „die Daten sprechen dafür“ wirken nüchtern — und verschieben doch unmerklich Verantwortung von einem Menschen auf ein Modell.
Entwicklung oder Kontrolle — eine Gestaltungsfrage
Dasselbe Instrument kann zwei sehr unterschiedliche soziale Logiken erzeugen. Ein geschützter Reflexionsraum, in dem Führungskräfte freiwillig ihre Kommunikationsmuster analysieren, kann außerordentlich wertvoll sein. Ein System, das Führungskräfte fortlaufend vermisst, vergleicht und bewertet, wird kaum bessere Führung hervorbringen. Es wird vor allem Anpassung produzieren. Menschen sprechen dann glatter, agieren vorsichtiger, riskieren weniger.
Daraus folgt: KI-Governance darf nicht auf Datenschutz, Werkzeugfreigaben und technische Sicherheit reduziert werden. Diese Aspekte sind notwendig, greifen aber zu kurz. Governance muss auch klären, welche soziale Logik entsteht — ob das System Reflexion fördert oder Kontrolle, ob es Verantwortung erhöht oder verschiebt. Zu klären ist außerdem, wer die Auswertungen sehen darf, ob sie der Entwicklung oder der Bewertung dienen und ob Teilnahme freiwillig ist.
In der Praxis entscheidet sich diese Logik früher, als viele glauben — bei scheinbar technischen Weichenstellungen. Ein Spiegel, dessen Auswertungen allein die Führungskraft sieht, erzeugt Entwicklung. Derselbe Spiegel, dessen Daten in Zielvereinbarungen wandern, erzeugt Anpassung.
Was Führung bleibt
Der Grund liegt in einer Eigenschaft von KI, die in Effizienzdebatten untergeht: Sie verstärkt, was vorhanden ist. Eine Organisation mit unklaren Entscheidungswegen wird durch KI nicht entscheidungsstärker. Wer Fehler kaschiert, wird durch bessere Analytik nicht lernfähiger. Die Vorfrage lautet deshalb nicht, welche Prozesse schneller werden, sondern ob eine Organisation reif genug ist, mit der Transparenz umzugehen, die KI erzeugt.
Gerade deshalb wird menschliche Urteilskraft wichtiger, nicht unwichtiger. Eine KI kann eine Gesprächssequenz auswerten, aber sie kennt die Vorgeschichte eines Konflikts nicht. Sie kann eine Entscheidungsoption strukturieren, aber sie trägt nicht die sozialen Folgen einer Fehlentscheidung.
Peter Drucker formulierte vor Jahrzehnten, die erste Führungsaufgabe bestehe darin, sich selbst zu führen. KI macht diese Aufgabe nicht überflüssig — sie macht sie überprüfbar.
Ob KI Führungskräfte ersetzt, ist damit nicht die entscheidende Frage. Wichtiger ist, ob Führungskräfte bereit sind, durch KI sichtbarer zu werden. KI nimmt Führung nicht die Verantwortung ab. Sie nimmt ihr die Ausreden.
Hinweis zur KI-Nutzung: Dieser Beitrag entstand nicht ausschließlich, aber unterstützend mithilfe von KI — insbesondere für Quellenrecherche, Quellenprüfung und sprachliche Qualitätssicherung.
Quellen
- Lange, Katharina / Parra Moyano, José (25.02.2026): How AI can coach us to improve how we communicate. I by IMD, IMD Business School, Lausanne. Werkzeugtest mit 167 Führungskräften; Zoneneinordnung nach Selbstauskunft; nicht begutachtet. Fundstelle der Werte 55 Prozent und 10 Prozent. imd.org
- Lange, Katharina / Parra-Moyano, José (14.02.2025): Research: How AI Helped Executives Improve Communication. Harvard Business Review. Vorabbericht zur selben Erhebung; Volltext kostenpflichtig. hbr.org
- Heron, John (2001): Helping the Client: A Creative Practical Guide. 5. Auflage, Sage, London. Sechs Interventionskategorien; Erstfassung des Modells 1975.
- Atwater, Leanne E. / Yammarino, Francis J. (1992): Does Self-Other Agreement on Leadership Perceptions Moderate the Validity of Leadership and Performance Predictions? Personnel Psychology 45(1), 141–164. DOI 10.1111/j.1744-6570.1992.tb00848.x
- Fleenor, John W. / Smither, James W. / Atwater, Leanne E. / Braddy, Phillip W. / Sturm, Rachel E. (2010): Self–other rating agreement in leadership: A review. The Leadership Quarterly 21(6), 1005–1034. DOI 10.1016/j.leaqua.2010.10.006
- Lee, Angela / Carpenter, Nichelle C. (2018): Seeing eye to eye: A meta-analysis of self-other agreement of leadership. The Leadership Quarterly 29(2), 253–275. DOI 10.1016/j.leaqua.2017.06.002
- Logg, Jennifer M. / Minson, Julia A. / Moore, Don A. (2019): Algorithm appreciation: People prefer algorithmic to human judgment. Organizational Behavior and Human Decision Processes 151, 90–103. Sechs Experimente, rund 1900 Teilnehmende. DOI 10.1016/j.obhdp.2018.12.005
- Dietvorst, Berkeley J. / Simmons, Joseph P. / Massey, Cade (2015): Algorithm aversion: People erroneously avoid algorithms after seeing them err. Journal of Experimental Psychology: General 144(1), 114–126. Fünf Studien, rund 2500 Teilnehmende. DOI 10.1037/xge0000033
- Castelo, Noah / Bos, Maarten W. / Lehmann, Donald R. (2019): Task-Dependent Algorithm Aversion. Journal of Marketing Research 56(5), 809–825. DOI 10.1177/0022243719851788
Korrekturhinweis, 10. September 2026. Bei einer Prüfung aller Zahlen gegen die Primärquellen waren vier Angaben ungenau; sie sind im Text oben korrigiert. Die beiden Prozentwerte standen als eine Verteilung, obwohl der eine Rückmeldungen und der andere Personen zählt. Sie waren dem Beitrag der Autoren in der Harvard Business Review zugeschrieben statt der frei zugänglichen Fassung bei I by IMD. Ein Befund zur Ablehnung algorithmischer Empfehlungen war den falschen Arbeiten zugeordnet. Und eine Quellenangabe, die sich nicht belegen ließ, ist entfallen. Die Beobachtung des Beitrags bleibt davon unberührt.
Dieser Beitrag gibt eine fachliche Einordnung wieder und ersetzt keine Rechts- oder Unternehmensberatung.