Vordenker
Wenn Ihr Mitarbeiter sich wie KI verhalten hätte, hätten Sie ihn längst entlassen.

Stellen Sie sich vor, Sie haben gerade jemanden neu eingestellt, und an den meisten Tagen ist er effizient, kompetent, wortgewandt und selbstbewusst. Er ist alles, was Sie sich erhofft haben, und zeigt viele der Eigenschaften eines hervorragenden Mitarbeiters.
Stellen Sie sich nun vor, dass dieser Mitarbeiter gelegentlich, wenn er mit einer Frage konfrontiert wird, deren Antwort er nicht kennt, einfach etwas erfindet. Es ist flüssig und überzeugend, sodass Sie es zunächst für bare Münze nehmen. Doch wenn es geschäftliche Konsequenzen hat, konfrontieren Sie den Mitarbeiter, fordern ihn heraus – und er kann seinen Denkprozess nicht erklären oder seine Vorgehensweise darlegen. Sie könnten ihm sogar sagen, dass er falsch liegt, nur um auf Gegenbehauptungen und weitere Erfindungen zu stoßen, die er zur Untermauerung anführt. Nach dem zweiten oder dritten Mal, dass das passiert, würden Sie ihn wahrscheinlich entlassen oder zumindest eine Abmahnung aussprechen? Die Antwort der meisten Arbeitgeber lautet fast mit Sicherheit ja.
Ich finde es verblüffend, dass Unternehmen heute kritische Arbeitsabläufe und Entscheidungsprozesse an einen ‚Mitarbeiter‘ übergeben, von dem bekannt ist, dass er dieses Verhalten zeigt. Der einzige Grund, warum das unbemerkt bleibt, ist, dass dieser ‚Mitarbeiter‘ Software und keine Person ist.
Warum KI nicht auf die gleiche Weise versagt wie Menschen
Unter Unternehmen, die KI einsetzen, herrscht häufig die falsche Annahme, dass ein Fehlerrate der Technologie im Wesentlichen dasselbe Problem wie menschliche Fehler darstellt und auf dieselbe Weise gehandhabt werden kann. Doch Kontrollen, Prüfungen und Eskalationen funktionieren bei großen Sprachmodellen (LLMs) nicht immer. Sie sind darauf ausgelegt, wie Menschen zu klingen, aber wenn man einen Blick unter die Haube wirft, sieht man, dass sie überhaupt nicht wie wir arbeiten.
Wenn ein Spitzenmitarbeiter einen Fehler macht, gehen wir davon aus, dass der Fehler ehrlich war – er hat sein Bestes gegeben und ist ausgerutscht. Das kommt vor. Wenn er jedoch bewusst eine Antwort erfindet, um nicht zuzugeben, dass er etwas nicht weiß, und das wiederholt, würden wir das als Fehlverhalten werten. Führungskräfte wissen, worauf sie ihre Aufsicht konzentrieren müssen, weil Schwierigkeitsgrad und Fehlermargen zusammenfallen. Sie können den Mitarbeiter bitten, seine Argumentation zu erklären und ihn dazu befragen. Der Mitarbeiter erkennt in der Regel, wenn er überfordert ist, und gibt das zu. Und nach einem Fehler lernt er, sodass sich derselbe Fehler nicht in einer endlosen Schleife wiederholt.
KI‑Systeme kehren jede dieser Annahmen um. Ihre Standardreaktion auf ein Versagen ist eine flüssige, selbstbewusste Erfindung. Sie liefern eine plausible, aber schlicht falsche Antwort, was exakt das Verhalten ist, das einer menschlichen Karriere das Ende setzen würde. LLMs sind darauf ausgelegt, die statistisch wahrscheinlichste Fortsetzung eines Textes zu erzeugen, und wenn sie die Antwort nicht kennen, produzieren sie häufig etwas, das trotzdem richtig klingen könnte. Die Forscher von OpenAI haben eingeräumt, dass ein gewisser Grad an faktischen Fehlern eine statistische Unvermeidlichkeit der Funktionsweise dieser Modelle ist, und dass das Training belohnt eine selbstsichere Vermutung gegenüber einem ehrlichen Eingeständnis von Unsicherheit.
Wo neurosymbolische Ansätze ins Spiel kommen
Genau dafür wurden neurosymbolische Ansätze entwickelt. Sie kombinieren neuronale Netze, die hervorragend darin sind, unstrukturierte, reale Sprache und Daten zu verstehen, mit deterministischer, regelbasierter Logik. Das bedeutet, dass die Schlussfolgerungen eines Systems aus expliziter, einsehbarer Logik resultieren, anstatt aus einem Prozess zu entstehen, den niemand einsehen kann.
Ohne diese zusätzliche Logikschicht, die neurosymbolische Technologie bietet, korrelieren die Fehler von KI nicht mit der Schwierigkeit der Arbeit, wie es bei Menschen der Fall ist – sie sind unvorhersehbar. Sie können bei trivialen Aufgaben auftreten, während schwierige Aufgaben problemlos bewältigt werden, was es erschwert, zu erkennen, wo die menschliche Aufsicht am besten konzentriert werden sollte. Ihre Erklärungen, sofern sie überhaupt gegeben werden, entstehen nachträglich und liefern kein echtes Bild davon, wie sie zu einer Schlussfolgerung gelangt sind. Derselbe Fehler kann unbegrenzt wiederkehren, weil niemand im System ist, der daraus lernt oder zur Verantwortung gezogen werden kann.
Vertrauen ohne Verständnis
Forscher haben dokumentiert, dass Menschen, die ein System neu kennenlernen, dazu neigen, es nach einem einzigen sichtbaren Fehler aufzugeben; wenn es jedoch ein vertrautes System ist, tendieren sie zum gegenteiligen Extrem – ihre Ausgaben akzeptieren einfach, weil sie sich daran gewöhnt haben, nicht weil diese Ausgaben zuverlässiger geworden sind. Selten wird das richtige Maß an Vertrauen erreicht, da dies davon abhängt, dass Menschen verstehen, wann ein KI‑System wahrscheinlich falsch liegt, und erkennen können, wann es das tut.
Das bedeutet nicht, dass KI nicht mit wichtigen Aufgaben betraut werden sollte. Es bedeutet, dass wir bereit waren, ihr ein Vertrauen zu schenken, das wir einer Person nicht gewähren würden, zum Teil weil es keinen eindeutigen Verantwortlichen gibt, der bei einem Versagen zur Rechenschaft gezogen werden kann.
Wenn KI urteilsbasierte Aufgaben übernehmen soll, wie es ein geschätzter Kollege tun würde, muss sie dieselben Grundstandards erfüllen. Antworten müssen überprüfbar sein, mit sichtbarer Argumentation, und akzeptieren, dass das Beste, was sie manchmal tun kann, ist zu sagen: „Ich weiß nicht“.












