„Schaffst Du das eigentlich noch?"
Es ist ja die freundlichste Frage der Welt, und sie ist trotzdem unbeantwortbar. Wer zugibt, eine vorgesehene Prüfung nicht mehr zu schaffen, sagt damit etwas über sich selbst — und sagt es jemandem, der über seine nächste Beurteilung mitentscheidet. In dieser Lage antwortet fast jeder, dass es eng ist, aber geht.
Das ist keine Unehrlichkeit. Das ist eben die vernünftige Antwort auf eine unfair gestellte Frage, und solange sie gestellt wird, erfährt man über die Prüfarbeit in Eurer Organisation genau gar nichts.
Die gute Nachricht: Man muss auch niemanden fragen. Die Zahlen liegen ohnehin da.
Zusammengerechnet hat es nur noch niemand
1951 fuhren zwei Forscher des Tavistock Institute in die Kohlegruben von Durham. Eric Trist und Ken Bamforth wollten wissen, warum eine technisch überlegene Abbaumethode weniger Kohle förderte als die alte, die sie ersetzt hatte. Den Grund fanden sie nicht an der Maschine, sondern daneben: Das neue Verfahren hatte die eingespielten Arbeitsgruppen zerschnitten.
Die Technik war besser. Das Ergebnis war schlechter. Und niemand hatte beides zusammengerechnet, weil es schlicht keine Zeile gab, in der beides vorkam.
Fünfundsiebzig Jahre später ist das Problem dasselbe, nur unsichtbarer. In Durham arbeitete der technische Teil erkennbar anders als vorher. Heute arbeitet er genauso wie vorher, nur um Größenordnungen schneller — es gibt nichts, worauf man zeigen könnte. Die Erhebung, um die es hier geht, macht deshalb nichts anderes, als diese eine fehlende Zeile herzustellen.
Sie dauert einen Vormittag.
Vier Größen, und keine davon muss jemand beantworten
Wie lange dauert eine Freigabe heute, verglichen mit der Zeit vor achtzehn Monaten?
Nicht die Bearbeitung, nicht der ganze Vorgang — der eine Schritt, an dem jemand zustimmt. Achtzehn Monate, weil der Abstand lang genug ist, um vor den meisten KI-Einführungen zu liegen, und kurz genug, dass die Zeitstempel noch im System stehen.
Wie viele Freigaben erteilt eine Person in der Woche?
Pro Kopf, nicht in der Summe. Die Summe wächst ja mit der Organisation und sagt deshalb nichts. Die Zahl je Kopf sagt, wie viele Minuten für einen Vorgang übrig bleiben, wenn man sie durch die Arbeitszeit teilt. Diese Division ist gelegentlich ein unangenehmer Moment.
Welcher Anteil der Vorgänge wird eine Ebene höher entschieden?
Steigt dieser Anteil, ist die Prüfung nicht verschwunden. Sie ist gewandert — meist zu jemandem, der noch weniger Zeit hat und den Fall schlechter kennt.
Die vierte ist keine Zahl, und sie ist die unbequemste.
Gibt es irgendwo ein Dokument, das festlegt, wofür eine Freigabe einsteht?
In den meisten Organisationen lautet die Antwort nein. Dann unterschreibt dort seit Jahren jemand regelmäßig etwas, ohne dass irgendwo stünde, was die Unterschrift eigentlich behauptet.
Was dabei herauskommt
Drei Lagen, und sie führen zu ganz verschiedenen Schlüssen.
Sind Vorbereitung und Bearbeitung schneller geworden, die Freigabe aber langsamer, habt Ihr den Befund vor Euch. Die Erzeugung ist billiger geworden, die Prüfung nicht, und die Differenz staut sich vor der Unterschrift.
Ist beides schneller geworden, wird es interessant. Vielleicht sind die Vorlagen tatsächlich besser geworden. Vielleicht wird aber auch nur nicht mehr geprüft, sondern quittiert. Die dritte Größe entscheidet das: Steigt gleichzeitig der Anteil der Eskalationen, ist es das Zweite.
Hat sich nichts verändert, ist auch das ein brauchbares Ergebnis und keine vergeudete Zeit. Dann erzeugt die Einführung an dieser Stelle eben keine Restlast. Haltet fest, dass Ihr nachgesehen habt, und wendet Euch dem nächsten Vorgang zu.
Das Zahlenpaar, wenn es schnell gehen muss
Wenn nur eine einzige Sache davon passiert, dann diese. Nehmt den KI-Einsatz, der bei Euch am längsten läuft, und stellt zwei Zahlen nebeneinander: wie viele Vorgänge er in der Woche erzeugt, und wie viele Stunden an der Stelle dafür vorgesehen sind, bei der sie ankommen.
Die erste liefert das System. Die zweite steht in der Planung, in einer Stellenbeschreibung oder in dem, was die Person auf Nachfrage sagt — hier ist Fragen ausnahmsweise unproblematisch, weil es um die Planung geht und nicht darum, ob jemand seine Arbeit schafft.
Zwei Stunden. Der Grund, warum diese beiden Zahlen in keinem Bericht nebeneinander stehen, ist übrigens ganz banal: Sie stammen aus zwei verschiedenen Systemen, die zwei verschiedene Leute pflegen.
„Bei uns prüft aber ein Mensch"
Der häufigste Einwand an dieser Stelle – hat einen berühmten Gegenfall.
Mehr als dreiundvierzigtausend Eltern in den Niederlanden sind inzwischen als Geschädigte anerkannt. Rückforderungen, oft über Zehntausende Euro, bei Familien, von denen die meisten nichts falsch gemacht hatten. Ein Risikomodell der Steuerbehörde, das unter anderem eine nicht niederländische Staatsangehörigkeit als Merkmal wertete, wählte Fälle für die Betrugsprüfung aus.
Für diese Fälle war eine menschliche Prüfung vorgesehen. Und sie hat sogar stattgefunden.
Die Sachbearbeiter sahen nur nicht, warum ein Fall ausgewählt worden war. Sie hielten sich an die Regel, und die Regel war die Einstufung des Systems. 2021 trat die Regierung darüber zurück.
Der Punkt daran ist nicht die Behörde, und schon gar nicht die Größenordnung. Der Punkt ist, dass eine vorgesehene und tatsächlich durchgeführte Prüfung nichts wert war, weil eine Bedingung fehlte, unter der sie überhaupt hätte wirken können. Wer prüft, muss sehen können, worauf er schaut.
Dass bei Euch ein Mensch draufschaut, ist also keine Antwort. Es ist erst die Voraussetzung dafür, die Frage zu stellen.
Wo das alles nicht gilt
Es gibt Arbeit, bei der auch die Prüfkosten gefallen sind, und dafür ist dieser ganze Befund keine Hilfe.
Wer Software schreibt, hat Testfälle. Ein automatisierter Test sagt in Sekunden, ob ein Ergebnis richtig ist — ohne Ansehen der Person und ohne jedes Betriebswissen. Dasselbe gilt für Rechnungen, für Formatprüfungen, für alles, wofür sich vorher aufschreiben lässt, woran man Korrektheit erkennt.
Die Frage für Eure Organisation lautet deshalb, welcher Anteil Eurer Arbeit sich auf diesem Weg prüfen lässt. In der Fertigung und in der Buchhaltung ist der Anteil beträchtlich. In allem, was mit Menschen, Märkten und Beziehungen zu tun hat, bleibt er klein. Ein Angebot ist nun mal nicht falsch, ein Bewerber ist nicht falsch. Sie sind angemessen oder unangemessen, und das entscheidet kein Test.
Wenn lieber ein Fall am Anfang steht als eine Tabelle
Dann nehmt einen einzigen KI-Einsatz — am besten den, der zuerst einfällt, nicht den, der am wichtigsten klingt — und geht ihn in fünf Schritten durch. Eine Viertelstunde, allein am Schreibtisch.
- Welcher Glaubenssatz schwingt mit? „KI kann das noch nicht." „Wenn wir das nicht nutzen, sind wir raus." „Das ist Sache der Führung." „Die KI hat das gemacht, nicht ich." Was hier zutrifft, verzerrt schon die Wahrnehmung, bevor der Fall überhaupt angesehen wird.
- Braucht dieser Fall überhaupt eine Regel? Fünf Fragen, und ein einziges Ja genügt: Rücknehmbarkeit, eine rechtliche Pflicht, die ohnehin gilt, Informationsasymmetrie gegenüber Betroffenen, Skalierung, Folgen für Dritte. Kein Ja? Dann haltet fest, dass Ihr geprüft habt, und
hört hier auf. - Wo liegt der Fall wirklich — entscheidet das System allein, schlägt es vor, oder liefert es nur zu? Ehrlich eingeordnet, nicht so, wie man es gern hätte.
- Fünf Perspektiven, je ein Wort: Unternehmen, Organisation, Belegschaft, Kunden, Gesellschaft. Jedes „unklar" ist ein Punkt, der nicht dadurch verschwindet, dass die anderen vier gut aussehen.
- Zwei Namen, keine Rollen: Wer ist betroffen, wer steht dafür ein? Zwei verschiedene Namen sind der Normalfall. Steht derselbe zweimal, oder fällt zur zweiten Frage niemand ein, habt Ihr das eigentliche Ergebnis schon.
Kein fertiges Ergebnis, keine Klausel, kein Zertifikat. Ein ehrlicher erster Blick auf einen einzigen Fall — und danach eine Zeile, die es vorher nirgends gab.
Woher das kommt
Die Kostenrechnung, die vier Größen und das Zahlenpaar stehen in Wer prüft, zahlt, Kapitel 3, die vier Kostenantworten in Kapitel 10 („Wem die Rechnung gehört“), die fünf Schritte im Anhang des Werkzeugteils. Die Leserate von rund 238 Wörtern je Minute stammt aus Marc Brysbaerts Metaanalyse von 2019 über 190 Studien. Eric Trist und Ken Bamforth haben ihre Beobachtung aus Durham 1951 veröffentlicht. Der niederländische Fall ist die Kindergeld-Affäre; der Untersuchungsausschuss sah die Hauptursachen in starren Gesetzen und einer Alles-oder-nichts-Praxis.