Vordenker
KI ist bereits intelligenter als Ihr Arzt. Das ist nicht der beängstigende Teil.

Ich wollte, dass KI dieses Problem löst.
Jahrelang habe ich komplizierte Patientengeschichten, Laborbefunde, Symptome, Medikamente, Nahrungsergänzungen und jahrelange frühere Behandlungen aufgenommen und versucht, all das in einen kohärenten klinischen Plan zu überführen. Ein komplexer Fall konnte drei Stunden Recherche in Anspruch nehmen, bevor ich mich sicher fühlte, zu entscheiden, was wichtig ist und was als Nächstes geschehen sollte.
Dann kam die generative KI.
Mein erster Gedanke war der offensichtliche: endlich.
Hier war eine Technologie, die enorme Informationsmengen verarbeiten, medizinisches Wissen schneller abrufen konnte als ich je könnte und in Sekunden Beziehungen innerhalb eines Falls finden konnte. Ich ging davon aus, dass ich eine Schnittstelle um ein großes Sprachmodell legen, ein paar Schutzmechanismen einbauen und fertig sein könnte.
Das wäre fabelhaft gewesen.
Stattdessen, etwa ein Jahr und $1 million später, arbeiteten Software‑Ingenieure zusammen mit einem zehnköpfigen klinischen Team, und wir waren immer noch am Aufbau.
Der Grund war nicht, dass KI nicht intelligent genug war.
Es war, dass Intelligenz der einfache Teil war.
Ich bekam eine andere KI als alle anderen
Mein erster Hinweis kam, bevor wir überhaupt versuchten, klinische Software zu entwickeln. Ich bemerkte immer wieder, dass ich dasselbe KI‑Werkzeug wie jemand neben mir verwenden konnte und dabei dramatisch bessere Ergebnisse erzielte.
Warum? Weil ich nicht einfach nur eine Frage stellte und die Antwort nahm. Ich habe mit ihr diskutiert. Annahmen hinterfragt. Kontext geliefert, den sie verpasst hatte. Fehler korrigiert. Den Rahmen geändert. Noch einmal nachgefragt.
Technisch nutzten wir dasselbe Werkzeug. Funktional jedoch nicht.
Das ist ein interessantes Produktivitätsproblem, wenn man eine Werbung schreibt. Es wird zu einem völlig anderen Problem, wenn das Thema ein Patient ist.
Ich habe mit mehr als 70 000 Praktikern zusammengearbeitet. Jemand kann klinisch brillant sein und dennoch schrecklich darin, nützliche Informationen aus einem KI‑System zu extrahieren.
Das sind unterschiedliche Fähigkeiten.
Doch scheint ein großer Teil der Antwort im Gesundheitswesen zu sein, dass Kliniker einfach „Prompt‑Engineering“ lernen müssen.
Ich halte das nicht für eine ernsthafte Lösung.
Wenn ein klinisches KI‑System von einem Arzt verlangt, ein versierter Prompt‑Engineer zu werden, bevor das System zuverlässig ist, haben wir die klinische KI noch nicht fertig gebaut.
Die Forschung sagt uns bereits etwas Unbehagliches
Eine randomisierte klinische Studie aus dem Jahr 2024 gab 50 Ärzten schwierige Diagnosefälle. Ärzte, die GPT‑4 nutzten, erzielten 76 Prozent; jene, die konventionelle Ressourcen nutzten, 74 Prozent, ein Unterschied, der statistisch nicht signifikant war.
Dann testeten die Forscher GPT‑4 allein. Es schlug die Ärzte, die konventionelle Ressourcen nutzten, um 16 Prozentpunkte.
Eine Studie aus dem Jahr 2026 in Pakistan ergab, dass Ärzte mit Zugang zu GPT‑4o nach einer KI‑Kompetenzschulung 71,4 Prozent bei der diagnostischen Argumentation erzielten, gegenüber 42,6 Prozent für jene, die konventionelle Ressourcen nutzten. Aber GPT‑4o allein erreichte 82,9 Prozent.
Eine Replikation aus dem Jahr 2026 im Vereinigten Königreich zeigte eine ähnliche Lücke: Ärzte verbesserten sich mit KI‑Unterstützung, lagen jedoch immer noch mehr als 21 Prozentpunkte unter dem Ergebnis des LLM, das allein arbeitete.
Wir müssen den unbequemen Teil laut aussprechen: Bei bestimmten kognitiven Aufgaben ist KI bereits besser als ein einzelner Arzt.
Kein Arzt hat jede medizinische Fachpublikation gelesen oder kann jede obskure Störung, Wechselwirkung oder Kontraindikation sofort erinnern, sobald sie relevant wird. KI kann enorme Informationsmengen verarbeiten, ohne müde zu werden oder Zeit zu verlieren.
Der Fehler besteht darin anzunehmen, wir könnten einen Chatbot vor einen Kliniker stellen und das Problem als gelöst betrachten.
Das leere Prompt‑Feld ist das Problem
Stellen Sie sich vor, ein Arzt lädt einen Laborbericht mit 150 Markern hoch und bittet ein LLM, ihn zu analysieren.
Die Antwort kommt wunderschön organisiert zurück. Es gibt nur ein Problem: Das System hat nicht zuverlässig alle 150 Marker extrahiert.
Allgemeine LLMs sind keine deterministischen klinischen Dokumentenparser. Tabellen und dichte medizinische Berichte bleiben besonders schwierig. Das beängstigende ist, dass die endgültige Antwort möglicherweise nicht ankündigt: „Ich habe 50 Werte verpasst.“
Sie kann einfach antworten.
Stellen Sie sich nun vor, einer dieser fehlenden Werte erfordert eine dringende medizinische Bewertung.
Das war keine Einschränkung, um die ich herumarbeiten wollte. Wir mussten eine andere Extraktionstechnologie entwickeln, um Laborberichte genau und reproduzierbar zu verarbeiten, bevor der Teil der klinischen Argumentation unseres Systems beginnen konnte.
Diese Erfahrung hat meine Sichtweise auf KI‑Sicherheit verändert.
Ein KI‑System, das Ihnen sagt, dass es etwas nicht weiß, ist unpraktisch.
Ein KI‑System, das nicht weiß, was es verpasst hat, ist gefährlich.
Warum wir über KI hinaus bauen mussten
Klinische Arbeit erfordert etwas, das generative KI von Natur aus nicht bietet: Reproduzierbarkeit.
Wir brauchten Kontrolle darüber, was hineingeht und was herauskommt: zuverlässige Datenerfassung, strukturiertes Wissen, deterministische Logik, Schutzmechanismen und Systeme, die Beziehungen im Verlauf der Patientengeschichte bewerten können.
Klinisches Denken ist nicht einfach eine Sammlung von Wenn‑Dann‑Aussagen. Manchmal ist das Signal die Beziehung zwischen mehreren Markern. Manchmal werden fünf einzeln unauffällige Befunde wichtig, wenn sie zusammen betrachtet werden.
Ingenieure benötigen Regeln, die explizit genug sind, damit die Software sie ausführen kann. Kliniker verbringen ihr Leben damit zu sagen: „Ja, außer …“
Die menschliche Biologie ist voller Ausnahmen, Modifikatoren, Kontext und konkurrierender Erklärungen. Zu Zeiten fühlte es sich an, als würde eine Gruppe in Gebärdensprache kommunizieren, während die andere Klingonisch spricht.
Die Antwort war nie „KI“ oder „nicht KI“. Es ging darum, genau zu bestimmen, wo jedes Element hingehört.
KI kann das Diagramm lesen. Menschen können den Raum lesen.
Richtig eingesetzt kann KI das Gedächtnis eines Klinikers erweitern, die Forschung beschleunigen, ungewöhnliche Möglichkeiten aufzeigen und Muster in riesigen Informationsmengen erkennen.
Das wirkt weniger wie ein Ersatz des Praktikers und mehr wie der Bau eines bionischen Praktikers.
Aber der Patient ist keine klinische Fallstudie.
Ein Praktiker hört das Zögern vor der Antwort. Sie bemerkt, wenn sich die Geschichte ändert. Sie lernt, dass ein Patient systematisch Symptome herunterspielt, während ein anderer jede Empfindung mit maximaler Intensität berichtet. Sie weiß, dass „Mir geht es gut“ eindeutig nicht immer gut bedeutet.
Diese Informationen existieren möglicherweise nie im Diagramm.
Menschliche Interaktion in der Medizin ist nicht nur eine angenehme Schicht, die wir hinzufügen, nachdem die Maschine die intellektuelle Arbeit erledigt hat. Sie ist eine weitere Quelle klinischer Daten.
KI kann das Diagramm lesen. Menschen können den Raum lesen.
Die besten klinischen Systeme werden beides benötigen.
Hören Sie auf zu fragen, ob KI den Arzt ersetzen wird
Wir stellen die falsche Frage.
Die Zukunft wird nicht unbedingt dem Unternehmen gehören, das den cleversten Chatbot oder das intelligenteste Grundmodell hat. Die wichtige Innovation geschieht zunehmend rund um das Modell: wie Informationen erfasst und verifiziert werden, welches Wissen bereitgestellt wird, was das System ableiten darf, wo deterministische Kontrollen übernehmen und wo ein Mensch im Prozess verbleiben muss.
Rohintelligenz wird immer reichlicher.
Zuverlässige Systeme, um diese Intelligenz anzuwenden, sind viel schwieriger zu bauen.
Und wir sollten dieses Problem nicht lösen, indem wir verlangen, dass jeder Kliniker ein Amateur‑KI‑Entwickler wird. Die Komplexität sollte in der Technologie liegen, nicht im Prompt des Arztes.
Der Arzt der Zukunft wird KI nicht im Gedächtnis übertreffen. Dieser Wettkampf wird bereits sinnlos.
Stattdessen sollten wir Systeme bauen, die Kliniker mit dem Gedächtnis, der Verarbeitungsgeschwindigkeit und der Mustererkennung der Maschine ausstatten, dabei aber den Kontext, das Urteilsvermögen, den Skeptizismus und die menschliche Verbindung des Praktikers bewahren.
Wir nennen das den bionischen Praktiker.
Ich vermute, Patienten werden es irgendwann viel einfacher nennen.
Ihren Arzt.












