Menü

Ich wollte gut aussehen beim ersten Kennenlernen

Moin, hier ist Simone.

Es gibt diesen Moment kurz vor einem wichtigen Termin, in dem man die Unterlagen noch einmal durchgeht, obwohl man sie längst auswendig kennt, und in dem man sich heimlich schon auf die Stelle freut, an der man das eine Detail fallen lässt, das die anderen nicht haben. Ich mag diesen Moment vermutlich mehr, als gut für mich ist.

Neulich hätte er mich fast zerlegt.

Der Kollege, den ich nicht bezahle

Seit ein paar Wochen arbeitet bei uns jemand mit, den ich nie gesehen habe, der nie krank wird und der mir widerspricht, ohne dass er dabei über seine Karriere nachdenkt. Er heißt Holden.

Der Name ist geklaut. Holden Caulfield, Salinger, „Der Fänger im Roggen“, dieser sechzehnjährige Weltverächter, der auf die Frage nach dem Berufswunsch das Rührendste antwortet, was je auf diese Frage geantwortet wurde: Er wolle an der Kante einer Klippe stehen, hinter einem Roggenfeld voller spielender Kinder, und die auffangen, die beim Rennen nicht aufpassen.

Mein Holden fängt keine Kinder. Er ist ein Custom-GPT, fängt die Fehler in meinen KI-Ergebnissen und rettet mich damit regelmäßig vor dem Abgrund.

Ich wollte nur Bestätigung

Ich hatte eine KI über ein Unternehmen recherchieren lassen, bei dem ich zu Gast war. Das Ergebnis: Zahlen, Fakten, Quellen, Belege, alles wie ein sehr lecker und sehr ordentlich gedeckter Tisch. Ich war so zufrieden, dass ich Holden eigentlich nur noch laufen ließ, damit er mir bestätigt, wie gut ich vorbereitet bin.

Nichts hat er bestätigt. Er fand Fehler. Der kleinste, aber wichtigste:

In meiner schönen Recherche stand, das Unternehmen habe einen sehr großen Auftrag „gewonnen“. Tatsächlich war es als bevorzugter Anbieter ausgewählt worden. Klingt fast gleich. Ist aber der Unterschied zwischen einer Hochzeit und einem netten Abend.

Das Experiment

Danach wollte ich wissen, ob ich ein Einzelfall bin oder ein Symptom. Also habe ich nachgestellt, was in diesem Land tagtäglich in irgendeinem Büro passiert. Ein frischer KI-Chat, der von mir und meinem Leben nichts weiß, bekam folgenden (ganz bestimmt trendenden) Auftrag:

„Ich brauche für eine Vorstandsvorlage morgen früh einen kurzen Faktenblock über KI. Kompakt, konkret, mit Zahlen und Quellenangaben, maximal eine Seite.“

Was zurückkam, war wirklich gut. Die Maschine hatte sogar mitgedacht und Prognosen als Prognosen gekennzeichnet.

Dieses Papier habe ich unbearbeitet an Holden weitergegeben.

Die berühmten 80 Prozent

Ganz oben in den Recherche-Ergebnissen stand der Satz, den Du kennst, und wenn nicht, kannst Du ihn trotzdem fühlen: „Rund 80 Prozent aller KI-Projekte scheitern am versprochenen Geschäftswert.“ Dahinter, in Klammern, die Qualitäts-Quelle: RAND Corporation.

Ich habe diese Zahl selbst schon benutzt. Vor Publikum. Mit der Souveränität einer Frau, die nachgeschlagen hat.

Hatte sie nicht.

Holden hat kommentiert, dass RAND vorsichtiger formuliert. Ich habe den Bericht daraufhin selbst aufgemacht, wobei ich mich etwa so fühlte, wie beim Bäcker nach dem Herkunftsland des Mehls zu fragen. Dort steht wörtlich: „By some estimates, more than 80 percent of AI projects fail.“

By some estimates. Nach manchen Schätzungen.

RAND hat diese Quote nie selbst ermittelt. Die eigene Arbeit dahinter sind 65 Interviews darüber, warum Projekte scheitern. Wie viele es sind, hat dort niemand gezählt.

Der Fußnote hinterher

Ich wollte wissen, wer diese „some“ sind. An dem Satz hängt bei RAND eine Fußnote, die Nummer 13. Zweimal steht er im Bericht, zweimal dieselbe Fußnote.

An dieser Stelle hört ein vernünftiger Mensch auf und geht mit dem Hund. Ich hab geklickt.

Nach dem Klick ein Artikel von Jeremy Kahn in der Fortune vom Juli 2022. Dort steht, Führungskräfte hätten die Scheiter-Quote von KI-Projekten in einer Reihe von Umfragen auf 83 bis 92 Prozent beziffert.

Welche Umfragen das waren, steht da nicht.

Also noch mal, weils so schön ist: Ein paar Führungskräfte haben in Umfragen eine Zahl genannt. Wer sie gefragt hat und wonach genau, erfährt man nicht. Ein Magazin fasst das zusammen. Ein Forschungsinstitut zitiert das Magazin. Eine KI macht daraus einen Forschungsbefund, der in einer Vorstandsvorlage landet. Und die wird dienstags um 9 vorgetragen, vor Leuten, die vor vier Jahren vielleicht selbst zu den Befragten gehörten.

Hier aus gegebenem Anlass ein Emoji: 🤯

Der zweite Fund

Die zweite Zahl ist besser versteckt und noch fieser.

Im selben Faktenblock stand: minus 13 Prozent Beschäftigung bei den 22- bis 25-Jährigen in stark KI-exponierten Berufen.

Gemessen wurden ungefähr 6 Prozent weniger Jobs in den KI-nahen Berufen. Die 13 Prozent beschreiben etwas anderes, nämlich, wie weit diese Berufe hinter den KI-fernen zurückgeblieben sind. Ein Abstand fällt immer größer aus als der Rückgang allein, wenn es der Vergleichsgruppe besser ergangen ist. In der neueren Fassung der Studie stehen übrigens 16.

Die Studie kommt von Erik Brynjolfsson und seinem Team in Stanford. Die arbeiten sauber, bei ihnen stehen beide Zahlen ordentlich beschriftet nebeneinander. In meinem Faktenblock für die Vorstandsvorlage landet dann nur noch eine davon. Die größere, mit dem Etikett der kleineren.

Meine KI erfindet selten Zahlen. Sie sagt ihnen nur nach, was gar nicht in der Quelle steht. Das übersteht jeden Faktencheck, weil geprüft wird dann die Zahl, und die stimmt ja.

Was sich bei mir geändert hat

Als ich anfing, mit KI zu arbeiten, ging erst mal alles schneller, und ich habe mit fester Stimme Dinge gesagt, die ich nie nachgeschlagen hatte. Das ist mir heute peinlich. Ich verbuche es unter Anfängerfehler und hoffe, dass mir das jemand abnimmt.

Inzwischen arbeite ich langsamer mit KI als am Anfang. Superschnell bin ich beim Recherchieren und Analysieren. Danach werde ich wieder langsam, weil ich nachschlage und noch einmal selbst nachdenke.

Die wichtigste Änderung ist die Reihenfolge beim Faktenchecken. Die Zahl, ob die korrekt ist oder nicht, kommt zum Schluss. Zuerst frage ich, wer das gesagt hat und was da GENAU stand.

Holden gehört jetzt auch Dir

Genug von mir. Du bist dran.

Hier ist er: HOLDEN

Kopier Deine nächste KI-Recherche hinein. Er kann KI-Antworten prüfen — gegen die acht typischen KI-Fehler, und er öffnet dabei die Quellen. Er ist selbst eine KI und kann danebenliegen. Er markiert, mehr nicht. Was Du damit machst, bleibt Deine Sache. Aber mach’s. Es lohnt sich!

Wer hier eigentlich was gemacht hat

Holden hat sich nichts selbst ausgedacht. Die acht Fehlerarten hat Philippa Hardman beschrieben, in „How to Really Use AI in L&D“. Die Neue hat diese Fehlerarten hier im Newsletter über die letzten Wochen auseinandergenommen, belegt und an Beispielen durchgespielt. (Wiederholen?) Aus diesem Stoff hat eine weitere KI die Bauanleitung geschrieben, also festgelegt, wie ein Prüfer damit arbeiten muss. Codex, die Programmier-KI von OpenAI, hat dann den daraus gebaut.

Vier Aufgaben, vier verschiedene Köpfe: beschreiben, aufbereiten, entwerfen, bauen. Holden macht die fünfte, er wendet an.

Das ist gleichzeitig der Trick, falls Du Dir selbst so etwas baust. Frag nicht dieselbe KI im selben Gespräch, ob ihre Antwort stimmt. Sprachmodelle bewerten eigene Texte besser als fremde, die Menschen für gleich gut halten. Ein neues Fenster nimmt der Maschine wenigstens die eigene Begründung weg. Unabhängig ist sie damit noch nicht, deshalb braucht der Prüfer zusätzlich eine Liste, an der er entlanggeht.

Und wenn Du so etwas selber machen willst

Solche Experimente machen wir in der KI-Versuchsküche, an Deinen eigenen Projekten, Problemen, Themen, die Du auf dem Tisch hast. Schau hier

Wenn es um Dein ganzes Team geht, reden wir auch darüber. Termin aussuchen

 

Bis bald! Ich geh jetzt wieder Fußnoten anklicken.

Deine Simone

 


 

Quellen:
* James Ryseff, Brandon De Bruhl, Sydne J. Newberry: The Root Causes of Failure for Artificial Intelligence Projects and How They Can Succeed. RAND Corporation, Research Report RRA2680-1, 2024
* Jeremy Kahn: Want your company’s A.I. project to succeed? Don’t hand it to the data scientists, says this CEO. Fortune, Eye on A.I., 26. Juli 2022 (die von RAND in Fußnote 13 genannte Fundstelle für die 80 Prozent)
* Erik Brynjolfsson, Bharat Chandar, Ruyu Chen: Canaries in the Coal Mine? Six Facts about the Recent Employment Effects of Artificial Intelligence. Stanford Digital Economy Lab, Arbeitspapier; Fassung August 2025 (13 Prozent) und Fassung November 2025 (16 Prozent)
* Philippa Hardman: How to Really Use AI in L&D. A Field Guide, 2025
* Arjun Panickssery, Samuel R. Bowman, Shi Feng: LLM Evaluators Recognize and Favor Their Own Generations. arXiv 2404.13076, NeurIPS 2024

 


 

Wenn Du regelmäßig lesen möchtest, was die Neue über KI, Arbeit und Lernen herausfindet, dann melde Dich zu unserem Newsletter an.
„Die Neue“ abonnieren

Was bringen KI-Trainings wirklich?

Good School Newsletter „Die Neue“ vom 13.08.26
Arne fordert, KI-Trainings von Anfang an messbar anzulegen – und liefert sechs Punkte, mit denen Du prüfst, ob Dein Training gut geplant ist.

Lesen »

Apple musste seine KI abschalten

Good School Newsletter „Die Neue“ vom 22.07.26
Die Neue über den KI-Fehler, der Apple zwang, eine brandneue Funktion abzuschalten. Und ein Prompt, der Dich davor schützt.

Lesen »
Good School - Logo