Vordenker

Große Sprachmodelle (LLM) in echte Geschäftsanwendungen integrieren

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Große Sprachmodelle sind überall. Jedes Kunden-Gespräch oder jede VC-Präsentation beinhaltet Fragen darüber, wie bereit LLM-Technologie ist und wie sie zukünftige Anwendungen antreiben wird. Ich habe einige Muster dazu in meinem vorherigen Beitrag behandelt. Hier werde ich über einige echte Muster für eine Anwendung in der Pharmaindustrie sprechen, an der Persistent Systems gearbeitet hat.

Große Sprachmodelle und Kernstärken

LLMs sind gut darin, Sprache zu verstehen, das ist ihre Stärke. Das häufigste Muster, das wir bei Anwendungen sehen, ist die retrieval-augmentierte Generierung (RAG), bei der Wissen aus externen Datenquellen kompiliert und als Prompt für das LLM zur Paraphrasierung einer Antwort bereitgestellt wird. In diesem Fall dienen superschnelle Suchmechanismen wie Vektordatenbanken und Elasticsearch-basierte Motoren als erste Suchlinie. Dann werden die Suchergebnisse in einen Prompt kompiliert und als API-Aufruf an das LLM gesendet.

Ein weiteres Muster ist die Generierung einer Abfrage auf strukturierten Daten, indem das LLM ein Datenmodell als Prompt und eine spezifische Benutzerabfrage erhält. Dieses Muster könnte verwendet werden, um eine fortschrittliche “Sprich mit deinen Daten”-Schnittstelle für SQL-Datenbanken wie Snowflake sowie Graphendatenbanken wie Neo4j zu entwickeln.

Große Sprachmuster für echte Einblicke nutzen

Persistent Systems hat kürzlich ein Muster für Blast Motion, ein Sport-Telematik-Unternehmen (Schlaganalyse für Baseball, Golf usw.), analysiert, um Empfehlungen auf der Grundlage von Zeitreihendaten von Spielersummen zu erhalten.

Bei komplexeren Anwendungen müssen wir oft die LLM-Anfragen mit der Verarbeitung zwischen den Anfragen verketten. Für ein Pharmazie-Unternehmen haben wir eine intelligente Trails-App entwickelt, die Patienten für klinische Studien basierend auf Kriterien filtert, die aus klinischen Studien-Dokumenten extrahiert werden. Hier haben wir einen LLM-Chain-Ansatz verwendet. Zuerst haben wir ein LLM entwickelt, um das Studien-Dokument zu lesen und mit dem RAG-Muster die Einschluss- und Ausschlusskriterien zu extrahieren.

Dafür wurde ein relativ einfaches LLM wie GPT-3.5-Turbo (ChatGPT) verwendet. Dann haben wir diese extrahierten Entitäten mit dem Datenmodell der Patienten-SQL-Datenbank in Snowflake kombiniert, um einen Prompt zu erstellen. Dieser Prompt wurde an ein leistungsfähigeres LLM wie GPT4 gesendet, um eine SQL-Abfrage zu erstellen, die Patienten filtert und auf Snowflake ausgeführt werden kann. Da wir LLM-Verkettung verwenden, können wir mehrere LLMs für jeden Schritt der Kette verwenden, was uns ermöglicht, die Kosten zu kontrollieren.

Derzeit haben wir uns entschieden, diese Kette deterministisch zu halten, um eine bessere Kontrolle zu haben. Das bedeutet, dass wir mehr Intelligenz in den Ketten und eine einfache, vorhersehbare Orchestrierung haben möchten. Jedes Element der Kette ist eine komplexe Anwendung, die in der Vorgeschichte von LLMs einige Monate zur Entwicklung benötigt hätte.

Weitere fortschrittliche Anwendungsfälle ermöglichen

Für einen fortgeschritteneren Fall könnten wir Agents wie ReAct verwenden, um das LLM zu prompten, um schrittweise Anweisungen für eine bestimmte Benutzerabfrage zu erstellen. Dies würde jedoch ein High-End-LLM wie GPT4 oder Cohere oder Claude 2 erfordern. Es gibt jedoch ein Risiko, dass das Modell einen falschen Schritt ausführt, der überprüft werden muss, um Sicherheitsvorkehrungen zu treffen. Dies ist ein Kompromiss zwischen der Verlagerung der Intelligenz in kontrollierbare Ketten oder der Autonomisierung der gesamten Kette.

Heute, da wir uns an das Zeitalter der generativen KI für Sprache gewöhnen, beginnt die Industrie, LLM-Anwendungen mit vorhersehbaren Ketten zu übernehmen. Wenn diese Übernahme wächst, werden wir bald damit beginnen, mehr Autonomie für diese Ketten über Agents zu experimentieren. Das ist, worum es in der Debatte über AGI geht, und wir sind interessiert, zu sehen, wie sich all dies im Laufe der Zeit entwickelt.

Dattaraj Rao, Chief Data Scientist bei Persistent Systems, ist der Autor des Buches “Keras to Kubernetes: The Journey of a Machine Learning Model to Production.” Bei Persistent Systems leitet Dattaraj das AI Research Lab, das state-of-the-art-Algorithmen in Computer Vision, Natural Language Understanding, Probabilistic Programming, Reinforcement Learning, Explainable AI usw. erforscht und deren Anwendbarkeit in den Bereichen Gesundheitswesen, Banking und Industrie demonstriert. Dattaraj hält 11 Patente im Bereich Machine Learning und Computer Vision.