Cookie Einstellungen

Stellen wir uns einmal folgende Situation vor: Es ist Mitte November und Sie sind mitten im Jahresgespräch mit einem Mitarbeitenden. Vor Ihnen sitzt jemand, dessen Arbeit in diesem Jahr sichtbar besser geworden ist: schneller, sauberer, mehr davon. Sie wissen, dass ein Teil davon mit der Hilfe von KI entstanden ist. Die Person weiß, dass Sie es wissen. Und keiner von Ihnen beiden spricht es an.

Dieses Schweigen ist keine Feigheit. Es ist das vernünftige Verhalten von zwei Menschen, für die niemand geklärt hat, was hier eigentlich der Maßstab ist. Solange offen bleibt, was eine KI-gestützte Leistung wert ist, ist jede Äußerung riskant: Lob könnte als Naivität gelten, ein kritischer Satz als Technikfeindlichkeit. Also bleibt die Frage im Raum stehen und wird in der Note verrechnet, ohne ausgesprochen zu werden.

Eine Erkenntnis, die wehtut

Im Jahr 2025 ist in den Proceedings of the National Academy of Sciences eine Untersuchung erschienen, die diesen Punkt sehr genau trifft. Reif, Larrick und Soll haben in vier präregistrierten Experimenten mit 4.439 Teilnehmenden dieselben Arbeitsergebnisse bewerten lassen, einmal mit dem Hinweis, KI sei beteiligt gewesen, einmal ohne. Das Ergebnis: Wer KI nutzt, gilt als fauler, weniger kompetent und weniger sorgfältig. Gleicher Text, gleiche Qualität, schlechteres Urteil über die Person.

Der aufschlussreichste Teil des Befunds ist nicht der Effekt selbst, sondern seine Verteilung. Am stärksten bestrafen jene, die selbst wenig mit KI arbeiten. Die Beurteilung misst an dieser Stelle also nicht die Leistung der beurteilten Person, sondern die Nähe der beurteilenden Person zum KI-Tool. Das ist ein Kalibrierungsfehler, und Kalibrierungsfehler werden nicht durch guten Willen behoben, sondern durch Maßstäbe.

Warum mehr Transparenz allein nichts verbessert

Die verbreitete Reaktion auf diesen Befund lautet: Wir brauchen mehr Offenheit, die Leute sollen einfach dazusagen, wenn KI beteiligt war. Der Appell ist gut gemeint und läuft trotzdem ins Leere, denn er verlangt von Beschäftigten, für ihre Ehrlichkeit zu zahlen.

Betrachten Sie es einmal aus der Sicht der beurteilten Person. Sie benennen die eigene KI-Nutzung: Ihre Beurteilung wird mit hoher Wahrscheinlichkeit schlechter, Ihr Ergebnis bleibt dasselbe. Sie benennen die KI-Nutzung nicht: Ihre Beurteilung bleibt gut, das Risiko ist gering, weil niemand es sicher nachweisen kann. Unter diesen Bedingungen ist Schweigen die dominante Strategie, und zwar für gute Mitarbeitende noch stärker als für schwache, weil sie mehr zu verlieren haben.

Eine Leistungsbeurteilung, die KI übergeht, beurteilt Mitarbeiter nach einem Maßstab, den es so in der Arbeitswelt vielfach nicht mehr gibt. Daraus folgt die Reihenfolge, die in den meisten Unternehmen vertauscht wird: Zuerst der Maßstab, dann die Offenheit. Wer Transparenz einführt, ohne die Beurteilungspraxis zu ändern, bekommt keine Transparenz, sondern eine Auslese nach Risikobereitschaft.

Kostenloser Check, ohne Anmeldung

Wo steht Ihr Unternehmen? Elf Fragen, zwei Minuten, ohne Anmeldung: Der KI-Zusammenarbeits-Check misst nicht Ihren Reifegrad, sondern was der Einsatz mit Ihrer Zusammenarbeit macht.

Check starten

Was eine Beurteilung wirklich messen sollte

Die zweite Untersuchung, die hier hilft, stammt aus dem Strategic Management Journal 2026. Yokoi, Laureiro-Martinez, Magni und Brusoni haben die Zusammenarbeit von Menschen und generativer KI in einem multinationalen Duftstoffhersteller untersucht, mit 27 Interviews und fünf Think-aloud-Übungen. Ihr Kernbefund zur Arbeit selbst: Der geistige Aufwand verschwindet nicht, er verlagert sich. Die Problemdefinition wird schneller erledigt, aber ihre Halbwertzeit geringer, weil neue Analysen jederzeit mit Hilfe von KI möglich sind. Dafür verlagert sich der Aufwand massiv nach hinten, in das Bewerten, Auswählen und Einordnen der Ergebnisse. Für viele Führungskräfte wird gerade das jetzt zum Problem.

Für die Beurteilung heißt das: Ein Beurteilungsbogen, der weiterhin Menge, Tempo und Fertigstellung in den Mittelpunkt stellt, bewertet genau den Teil der Arbeit, der schnell und einfach zu haben ist , und ignoriert den Teil, der Zeit, Aufmerksamkeit und Reflextionsvermögen erfordert.

Konkret wird das an fast jedem bestehenden Beurteilungsbogen sichtbar. Früher lautete die Frage, wer den Bericht schreibt. Heute lautet sie, wer merkt, dass der Bericht an zwei Stellen nicht stimmt. Kriterien wie Termintreue und Arbeitsmenge messen weiterhin zuverlässig, nur eben etwas, das keine Knappheit mehr abbildet. Und ein Kriterium wie Selbstständigkeit hat seine Bedeutung stillschweigend geändert: Es hieß einmal, jemand kommt ohne Hilfe zum Ergebnis. Heute kommt jeder ohne Hilfe zu einem Ergebnis. Die Frage ist, ob er erkennt, wann dieses Ergebnis nicht richtig ist oder nicht trägt.

Der Einwand, der sofort kommt

An dieser Stelle kommt in Führungskreisen regelmäßig der Satz: Das führt doch direkt zur Überwachung. Der Einwand verwechselt zwei Fragen, die sorgfältig getrennt gehören.

Die erste Frage lautet: Beurteilt KI Menschen? Das ist algorithmisches Management, und es ist in deutschen Unternehmen bisher die Ausnahme. In der Konstanzer KI-Studie 2026 berichten 0,9 Prozent der Beschäftigten von einer KI-gestützten Leistungsbeurteilung. Die zweite Frage lautet: Beurteilen Menschen Arbeit, an der KI beteiligt war? Das ist der Alltag, und darum geht es hier.

Wo Software Nutzung tatsächlich mitzählt, ist die Sache mitbestimmungspflichtig. Das Arbeitsgericht Hamburg hat am 16. Januar 2024 entschieden, dass die rein private Nutzung im Browser ohne Zugriff des Arbeitgebers kein Mitbestimmungsrecht auslöst (24 BVGa 1/24). Ausgelöst wird es, sobald auf Firmengeräten installiert wird, der Arbeitgeber auf Nutzungsdaten zugreifen kann oder ein System Leistungskennzahlen erfasst. Der DGB fordert in seiner Sonderausgabe zu KI vom Februar 2026 ausdrücklich, individuelle Leistungsprognosen durch KI auszuschließen, und Betriebsräte der IG Metall berichten zu 32 Prozent von zunehmender Fremdkontrolle. Das ist keine Rechtsauskunft, sondern der Grund, dieses Thema mit dem Betriebsrat zu besprechen, bevor eine Software es entscheidet.

Und es gibt ein praktisches Argument gegen das Messen der Nutzung, das ganz ohne Recht auskommt: Es misst das Werkzeug und nicht die Arbeit. Eine Nutzungsquote sagt nichts darüber, ob ein Ergebnis gut war.

Vier Leitsätze, die ohne neues System funktionieren

Sie brauchen kein neues Beurteilungssystem und keine Software. Sie brauchen vier Sätze, die Ihr Führungskreis gemeinsam beschließt und danach anwendet.

Erstens: Beurteilt wird das Ergebnis und die Verantwortung dafür, nicht das KI-Tool. Wer unterschreibt, haftet für das, was darin steht, unabhängig davon, wie der erste Entwurf entstanden ist. Das entlastet die Ehrlichen und belastet niemanden zusätzlich.

Zweitens: Urteilsqualität zählt mehr als Menge. Die prüfbare Frage dazu ist einfach und in jedem Gespräch stellbar: Welche Variante haben Sie verworfen, und warum? Wer das beantworten kann, hat geurteilt. Wer es nicht kann, hat abgeliefert.

Drittens: Prüftiefe wird benannt, nicht vermutet. Wer ein Ergebnis weitergibt, sagt dazu, was er geprüft hat und was nicht. Das ist der einzige Satz der vier, der eine kleine Verhaltensänderung verlangt, und er ist der wirksamste, weil er Ehrlichkeit in eine Leistung verwandelt statt in ein Risiko.

Viertens: Weitergabe ist Leistung. Wer anderen zugänglich macht, wie er schneller geworden ist, leistet mehr als jemand, der denselben Vorteil für sich behält. Ohne diesen Satz privatisiert Ihr Unternehmen den Ertrag aus KI, und genau das ist der Grund, warum in der Geschäftsentwicklung nichts ankommt, obwohl einzelne Menschen erkennbar schneller arbeiten.

Zwei Dinge gehören ausdrücklich nicht in den Beurteilungsbogen im Jahresgespräch: die Menge des Erzeugten und die Frage, ob und welches Tool benutzt wurde.

Warum das im Führungskreis beschlossen werden muss

Vier Sätze zu formulieren dauert eine Stunde. Sie gemeinsam gleich zu verstehen dauert länger, und dieser zweite Teil ist die eigentliche Arbeit. Denn der Befund aus der PNAS-Studie gilt auch für Ihren Führungskreis: Dieselbe Arbeitsprobe wird von zwei Führungskräften unterschiedlich bewertet, je nachdem, wie nah sie selbst an KI-Tools sind. Wenn Sie diese Streuung nicht kennen, beschließen Sie Leitsätze, die im Anschluss jeder anders anwendet.

Das lässt sich messen, und zwar an einem halben Tag: dieselben Arbeitsproben, ein Teil mit dem Hinweis auf KI-Beteiligung, ein Teil ohne, die Differenz wird im Raum ausgerechnet. Danach fällt das Gespräch über Kriterien deutlich leichter, weil niemand mehr über Haltungen streitet, sondern über eine Zahl aus dem eigenen Kreis.

Drei Dinge vor der nächsten Beurteilungsrunde

Erstens, den Beurteilungsbogen durchgehen und jedes Kriterium prüfen, ob es Menge, Tempo oder Fertigstellung misst. Was übrig bleibt, ist Ihr heutiger Maßstab, und in den meisten Häusern ist das weniger, als die Beteiligten glauben.

Zweitens, die vier Leitsätze in einer Sitzung beschließen und zwei davon in den bestehenden Bogen schreiben, nicht alle vier. Zwei neue Kriterien werden angewendet, vier werden umgangen.

Drittens, den Beurteilenden eine Frage vorgeben, die sie in jedem Gespräch stellen: Welche Variante haben Sie verworfen, und warum? Das ist der kleinste Eingriff mit der größten Wirkung, weil er die Beurteilung vom Ergebnis auf das Urteil darüber verschiebt, ohne dass ein einziges Formular neu gedruckt werden muss.

Und wenn Sie wissen wollen, wo Ihr Unternehmen steht

Eines der fünf Handlungsfelder in unserem kostenlosen Check heißt Leistung und Anerkennung, und es ist das Feld, in dem die Antworten am weitesten auseinandergehen. Elf Fragen, zwei Minuten, keine Anmeldung, das Ergebnis steht sofort auf dem Schirm, dazu zwei bis drei Dinge, die Sie selbst anfangen können.

Kostenloser Check, ohne Anmeldung

Wo steht Ihr Unternehmen? Elf Fragen, zwei Minuten, ohne Anmeldung: Der KI-Zusammenarbeits-Check misst nicht Ihren Reifegrad, sondern was der Einsatz mit Ihrer Zusammenarbeit macht.

Check starten

Wenn Sie die Kriterienfrage mit Ihrem Führungskreis bearbeiten wollen, statt allein: Genau das ist die Führungswerkstatt KI. Vier Stunden, bis 16 Personen, am Ende stehen Ihre eigenen Beurteilungsleitsätze im Wortlaut und der Verzerrungswert Ihrer Gruppe auf dem Papier. Wie das mit den übrigen vier Handlungsfeldern zusammenhängt, steht unter KI & Zusammenarbeit.

Quellen: Reif, Larrick und Soll, PNAS 2025, vier präregistrierte Experimente mit 4.439 Teilnehmenden · Yokoi, Laureiro-Martinez, Magni und Brusoni, Strategic Management Journal 2026, DOI 10.1002/smj.70089, Open Access · Konstanzer KI-Studie 2026, Universität Konstanz · DGB, Sonderausgabe KI, Februar 2026 · ArbG Hamburg, 16.01.2024, 24 BVGa 1/24

Dr. Martin Bethke

20 Jahre Erfahrung im Top-Management in multinationalen Unternehmen, Start-ups und NGOs. Falls Sie Fragen zu diesem Artikel oder Interesse an einer Zusammenarbeit haben, schreiben Sie mir oder besuchen Sie mich auf LinkedIn.