Vordenker
Das Datenproblem im Herzen der AI-gestützten Arzneimittelentdeckung

Da sich künstliche Intelligenz (KI) rasant in der Arzneimittelentdeckung etabliert, ist vielleicht die wichtigste Frage nicht, wie leistungsfähig das nächste Modell sein wird, sondern welche Daten diese Modelle tatsächlich lernen.
Die jüngste Expansion von Anthropic in die Arzneimittelentwicklung ist das neueste Zeichen dafür, dass künstliche Intelligenz über allgemeine Reasoning-Fähigkeiten hinausgeht und in die angewandte Wissenschaft eindringt. Dies spiegelt echten Schwung in der Branche wider und wachsendes Vertrauen, dass KI die Art und Weise, wie neue Medikamente entdeckt werden, nachhaltig verändern kann. Doch wenn das Ziel darin besteht, die klinische Erfolgsrate zu verbessern und nicht nur die Entdeckung zu beschleunigen, sollten wir fragen, ob die biologischen Daten, auf denen diese Systeme basieren, in der Lage sind, ihnen beizubringen, wie die menschliche Biologie tatsächlich aussieht.
Jahrelang lag der Fokus der Branche auf dem Aufbau immer komplexerer Algorithmen. Größere Modelle, mehr Rechenleistung und bessere Architekturen haben bemerkenswerte Fortschritte in der Proteinstrukturvorhersage, Zielidentifizierung, Moleküldesign und anderen Bereichen der biomedizinischen Forschung ermöglicht. Diese Innovationen verdienen die Aufmerksamkeit, die sie erhalten haben.
Was jedoch viel weniger Aufmerksamkeit erhalten hat, ist die biologische Grundlage unter ihnen.
KI ist außergewöhnlich gut darin, Muster zu erkennen. Aber sie kann nicht zwischen Biologie, die nur messbar ist, und Biologie, die tatsächlich vorhersagbar ist, was in Patienten passiert, unterscheiden. Die Obergrenze für KI-gestützte Arzneimittelentdeckung wird letztlich nicht nur durch die Intelligenz der Modelle bestimmt, sondern durch die Qualität der menschlichen Daten, die zur Ausbildung, Validierung und Benchmarking verwendet werden. Wenn wir wollen, dass KI bessere Medikamente liefert und nicht nur schnellere Hypothesen, kann der Aufbau von hochwertiger menschlicher biologischer Dateninfrastruktur genauso wichtig sein wie der Aufbau der nächsten Generation von KI selbst.
KI kann nur aus der Biologie lernen, die wir ihr geben
Jedes KI-Modell ist durch die Informationen eingeschränkt, die es lernt. Die Arzneimittelentwicklung stellt eine besonders schwierige Herausforderung dar, da die Biologie außergewöhnlich komplex ist. Die menschliche Krankheit wird von Genetik, Alter, Geschlecht, Komorbiditäten, Immunantworten, Umweltexpositionen und Tausenden von interagierenden molekularen Wegen beeinflusst, die nur teilweise verstanden sind.
Historisch gesehen stammt ein Großteil der experimentellen Daten, die während der Arzneimittelentwicklung verwendet werden, aus Tierstudien, immortalisierten Zelllinien, vereinfachten In-vitro-Systemen und Computersimulationen. Diese Werkzeuge haben die biomedizinische Wissenschaft enorm vorangebracht und bleiben unverzichtbar in vielen Forschungsstadien. Es wurde jedoch auch gezeigt, dass sie die menschliche Physiologie nicht vollständig nachahmen können.
Ungefähr 90% der Arzneimittelkandidaten, die in klinische Studien eintreten, scheitern letztendlich, wobei mangelnde Wirksamkeit und unerwartete Sicherheitsprobleme zu den Hauptgründen gehören. Während viele Faktoren zu diesen Misserfolgen beitragen, ist ein wiederkehrendes Thema, dass präklinische Modelle oft Schwierigkeiten haben, vorherzusagen, was tatsächlich in Patienten passiert.
Wenn KI-Systeme hauptsächlich auf Daten trainiert werden, die aus Modellen stammen, die selbst bekannte translationalen Einschränkungen haben, sollte es nicht überraschend sein, wenn diese Einschränkungen bestehen bleiben. KI kann Muster außergewöhnlich gut erkennen, aber sie kann keine biologische Wahrheit erfinden, die nie in ihren Trainingsdaten vorhanden war.
Mehr Daten sind nicht unbedingt bessere Daten
Die KI-Gemeinschaft spricht oft über Skalengesetze: die Beobachtung, dass größere Datensätze häufig die Modellleistung verbessern. In der Biologie jedoch sind Quantität und Qualität nicht austauschbar. Millionen von Datenpunkten, die aus experimentellen Systemen gesammelt werden, die die menschliche Physiologie nicht gut widerspiegeln, können weniger Vorhersagewert bieten als kleinere Datensätze, die direkt aus klinisch relevanten menschlichen biologischen Daten generiert werden. Dieser Unterschied wird besonders wichtig in der Arzneimittelentwicklung, wo das Ziel nicht nur die Vorhersage, sondern die Vorhersage ist, die sich in erfolgreichen Patientenergebnissen niederschlägt.
Hochwertige menschliche biologische Daten unterscheiden sich von herkömmlichen Labor-Datensätzen in mehreren wichtigen Aspekten. Sie erfassen biologische Funktionen anstelle von statischen Momentaufnahmen. Sie bewahren Beziehungen zwischen Geweben, zellulärer Architektur, Perfusion, Metabolismus und Pharmakologie. Sie integrieren Patientengeschichte, klinische Merkmale, molekulare Messungen und funktionelle Antworten innerhalb desselben biologischen Systems. Am wichtigsten ist, dass sie Biologie messen, die tatsächlich in Menschen existiert.
Da KI immer besser darin wird, subtile Muster aus komplexen Daten zu extrahieren, wird die Qualität dieser Muster untrennbar von der Qualität der zugrunde liegenden Biologie.
Der nächste Wettbewerbsvorteil kann die menschliche Dateninfrastruktur sein
In den letzten Jahren sind enorme Investitionen in Grundmodelle, Recheninfrastruktur und spezielle KI-Architekturen geflossen. Viel weniger Aufmerksamkeit wurde der Infrastruktur gewidmet, die erforderlich ist, um hochwertige menschliche biologische Daten systematisch und im großen Maßstab zu generieren.
Menschliche biologische Proben sind von Natur aus begrenzt und erfordern die Integration mit einer Art von Spenden-Infrastruktur. Standardisierung bleibt herausfordernd. Experimentelle Protokolle müssen reproduzierbar sein. Metadaten müssen umfassend sein. Multiomische Messungen, Bildgebung, funktionelle Assays und klinischer Kontext müssen alle in Datensätze integriert werden, die konsistent genug für das computergestützte Lernen sind.
Nichts davon ähnelt herkömmlicher Software-Entwicklung. Stattdessen erfordert es koordinierte biologische Operationen, die in der Lage sind, reproduzierbare, regulatorisch einwandfreie Datensätze über viele Jahre hinweg zu produzieren. Genau wie Cloud-Infrastruktur für die moderne Software-Entwicklung unerlässlich wurde, kann die menschliche biologische Infrastruktur für die nächste Generation von KI-getriebenen Therapien grundlegend werden. Die Organisationen, die heute in diese Infrastruktur investieren, können letztendlich bestimmen, was die KI-Modelle von morgen lernen können.
Regulierungsbehörden bewegen sich in diese Richtung
Wichtig ist, dass diese Diskussion über akademische Neugier hinausgeht. Regulierungsbehörden betonen zunehmend menschlich relevante Beweise. Die FDA hat ihre Unterstützung für New Approach Methodologies (NAMs) erweitert, Pfade skizziert, auf denen computergestützte Modelle, Organ-on-Chip-Technologien, fortgeschrittene In-vitro-Systeme und andere menschlich relevante Ansätze zur regulatorischen Entscheidungsfindung beitragen können.
Dieser Schritt erkennt eine wichtige Realität an. Da computergestützte Methoden immer komplexer werden, hängt das Vertrauen in ihre Vorhersagen vom Vertrauen in die biologischen Beweise ab, die sie unterstützen. Wenn bessere KI bessere Validierung erfordert und bessere Validierung bessere menschliche Daten erfordert, dann muss bessere KI auch bessere menschliche Daten erfordern, die an der Quelle jedes Modells liegen.
Das nächste Jahrzehnt wird durch die Datenqualität definiert
Die Pharmaindustrie hat mehrere technologische Revolutionen von High-Throughput-Screening bis Next-Generation-Sequencing erlebt. Jede hat das Volumen der verfügbaren Daten erweitert, aber die Anwendung von KI in diesem Bereich stellt etwas anderes dar.
Ihr Erfolg hängt nicht nur davon ab, mehr Daten zu produzieren, sondern auch davon, Daten zu produzieren, die die menschliche Biologie treuer widerspiegeln. Da Grundmodelle immer zugänglicher werden, können alleinige algorithmische Vorteile weniger haltbar werden. Der Zugang zu differenzierten, hochwertigen menschlichen biologischen Daten kann stattdessen als einer der definierenden Wettbewerbsvorteile im Pharmazeutischen Ökosystem auftauchen. Dies ist besonders wahr, wenn das ultimative Ziel der Branche darin besteht, die klinische Erfolgsrate zu verbessern und nicht nur die Entdeckung zu beschleunigen.
Der Eintritt von Anthropic in die Arzneimittelentwicklung spiegelt den bemerkenswerten Fortschritt wider, den KI in den letzten Jahren gemacht hat. Er hebt auch die nächste Frage hervor, die die Branche beantworten muss. Wenn KI tatsächlich das Potenzial hat, die Medizin zu verändern, auf welcher biologischen Grundlage werden diese Modelle dann stehen?
Die Zukunft der KI-gestützten Arzneimittelentdeckung wird zweifellos von besseren Algorithmen abhängen. Aber sie kann noch mehr von dem Aufbau der menschlichen Dateninfrastruktur abhängen, die in der Lage ist, diesen Algorithmen beizubringen, wie die menschliche Biologie tatsächlich aussieht.












