Vordenker

Entschlüsselung von Chancen und Herausforderungen für LLM-Agents in Generative KI

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Wir sehen eine Entwicklung von Generativ-KI-Anwendungen, die von großen Sprachmodellen (LLM) angetrieben werden, von Prompts zu Retrieval-augmentierter Generation (RAG) bis hin zu Agents. Agents werden in der Branche und in Forschungskreisen stark diskutiert, vor allem wegen der Macht, die diese Technologie bietet, um Unternehmensanwendungen zu transformieren und eine überlegene Kundenexperience zu bieten. Es gibt gemeinsame Muster für den Bau von Agents, die erste Schritte in Richtung künstlicher allgemeiner Intelligenz (AGI) ermöglichen.

In meinem vorherigen Artikel sahen wir eine Leiter der Intelligenz von Mustern für den Bau von LLM-gepowerten Anwendungen. Beginnend mit Prompts, die das Problem-Domain erfassen und das interne Gedächtnis von LLM verwenden, um Ausgaben zu generieren. Mit RAG ergänzen wir den Prompt mit externem Wissen, das aus einer Vektordatenbank gesucht wird, um die Ausgaben zu kontrollieren. Als nächstes können wir durch die Verkettung von LLM-Aufrufen Workflows aufbauen, um komplexe Anwendungen zu realisieren. Agents bringen dies auf ein nächstes Level, indem sie automatisch bestimmen, wie diese LLM-Ketten gebildet werden sollen. Lassen Sie uns genauer hinsehen.

Agents – Unter der Haube

Ein wichtiger Aspekt von Agents ist, dass sie die Sprachverständnis-Kraft von LLM nutzen, um einen Plan zu erstellen, wie ein bestimmtes Problem gelöst werden kann. Das LLM versteht das Problem und gibt uns eine Sequenz von Schritten, um das Problem zu lösen. Es hört jedoch nicht dort auf. Agents sind kein reines Support-System, das Empfehlungen zur Lösung des Problems gibt und dann den Ball an uns weitergibt, um die empfohlenen Schritte auszuführen. Agents sind mit Werkzeugen ausgestattet, um voranzuschreiten und die Aktionen auszuführen. Erschreckend, oder?!

Wenn wir einen Agenten eine grundlegende Frage wie diese stellen:

Mensch: Welche Firma hat der Erfinder des Telefons gegründet?

Das Folgende ist ein Beispiel für die Denkschritte, die ein Agent unternehmen könnte.

Agent (DENKEN):

  • Gedanke: Ich muss nach dem Erfinder des Telefons suchen.
  • Aktion: Suche [Erfinder des Telefons]
  • Beobachtung: Alexander Graham Bell
  • Gedanke: Ich muss nach einer Firma suchen, die von Alexander Graham Bell gegründet wurde
  • Aktion: Suche [Firma gegründet von Alexander Graham Bell]
  • Beobachtung: Alexander Graham Bell gründete die American Telephone and Telegraph Company (AT&T) im Jahr 1885
  • Gedanke: Ich habe die Antwort gefunden. Ich werde sie zurückgeben.

Agent (ANTWORT): Alexander Graham Bell gründete AT&T im Jahr 1885

Man kann sehen, dass der Agent einer methodischen Art folgt, um das Problem in Teilprobleme zu zerlegen, die durch bestimmte Aktionen gelöst werden können. Die Aktionen hier werden vom LLM empfohlen, und wir können sie bestimmten Werkzeugen zuordnen, um diese Aktionen auszuführen. Wir könnten ein Suchwerkzeug für den Agenten aktivieren, sodass, wenn er erkennt, dass das LLM eine Suche als Aktion empfohlen hat, es dieses Werkzeug mit den Parametern aufruft, die vom LLM bereitgestellt werden. Die Suche kann im Internet oder in einer internen Wissensdatenbank wie einer Vektordatenbank durchgeführt werden. Das System wird jetzt selbstständig und kann komplexe Probleme lösen, indem es eine Reihe von Schritten ausführt. Frameworks wie LangChain und LLaMAIndex bieten eine einfache Möglichkeit, diese Agents zu bauen und mit Werkzeugen und APIs zu verbinden. Amazon hat kürzlich ihr Bedrock-Agents-Framework veröffentlicht, das eine visuelle Oberfläche für die Gestaltung von Agents bietet.

Unter der Haube folgen Agents einem speziellen Stil, um Prompts an das LLM zu senden, die es dazu bringen, einen Aktionsplan zu generieren. Das obige Muster von Gedanke-Aktion-Beobachtung ist bei einem Typ von Agent namens ReAct (Reasoning and Acting) beliebt. Andere Arten von Agents umfassen MRKL und Plan & Execute, die sich hauptsächlich in ihrem Prompt-Stil unterscheiden.

Für komplexere Agents können die Aktionen mit Werkzeugen verbunden sein, die Änderungen in Quellsystemen verursachen. Zum Beispiel könnten wir den Agenten mit einem Werkzeug verbinden, das den Urlaubssaldo überprüft und einen Urlaubsantrag in einem ERP-System für einen Mitarbeiter stellt. Jetzt könnten wir einen schönen Chatbot bauen, der mit Benutzern interagiert und über einen Chat-Befehl einen Urlaubsantrag im System stellt. Keine komplexen Bildschirme mehr für die Beantragung von Urlaub, eine einfache, einheitliche Chat-Oberfläche. Klingt aufregend!?

Vorsichtsmaßnahmen und Bedarf an verantwortungsvoller KI

Was passiert, wenn wir ein Werkzeug haben, das Transaktionen auf dem Aktienmarkt mithilfe einer vorab autorisierten API ausführt? Wir bauen eine Anwendung, in der der Agent die Aktienkurse untersucht (mithilfe von Werkzeugen) und Entscheidungen über den Kauf und Verkauf von Aktien trifft. Was, wenn der Agent die falsche Aktie verkauft, weil er halluziniert und eine falsche Entscheidung getroffen hat? Da LLM riesige Modelle sind, ist es schwierig zu bestimmen, warum sie bestimmte Entscheidungen treffen, daher sind Halluzinationen in Abwesenheit von geeigneten Schutzmechanismen häufig.

Während Agents faszinierend sind, haben Sie wahrscheinlich bereits erraten, wie gefährlich sie sein können. Wenn sie halluzinieren und eine falsche Aktion ausführen, die zu enormen finanziellen Verlusten oder großen Problemen in Unternehmenssystemen führen kann. Daher wird verantwortungsvolle KI in der Ära von LLM-gepowerten Anwendungen immer wichtiger. Die Prinzipien der verantwortungsvollen KI umfassen Reproduzierbarkeit, Transparenz und Rechenschaftspflicht und versuchen, Schutzmechanismen für Entscheidungen zu schaffen, die von Agents getroffen werden, und Risikoanalysen vorzuschlagen, um zu bestimmen, welche Aktionen eine menschliche Überwachung erfordern. Da komplexere Agents entworfen werden, benötigen sie mehr Prüfung, Transparenz und Rechenschaftspflicht, um sicherzustellen, dass wir wissen, was sie tun.

Abschließende Gedanken

Die Fähigkeit von Agents, einen Pfad logischer Schritte mit Aktionen zu generieren, bringt sie der menschlichen Argumentation sehr nahe. Sie mit leistungsfähigeren Werkzeugen auszustatten, kann ihnen Superkräfte verleihen. Muster wie ReAct versuchen, die Art und Weise nachzuahmen, wie Menschen Probleme lösen, und wir werden bessere Agenten-Muster sehen, die für bestimmte Kontexte und Branchen (Bankwesen, Versicherungen, Gesundheitswesen, Industrie usw.) relevant sind. Die Zukunft ist hier, und die Technologie hinter den Agents ist bereit für uns. Gleichzeitig müssen wir jedoch eng auf die Schutzmechanismen der verantwortungsvollen KI achten, um sicherzustellen, dass wir nicht Skynet aufbauen!

Dattaraj Rao, Chief Data Scientist bei Persistent Systems, ist der Autor des Buches “Keras to Kubernetes: The Journey of a Machine Learning Model to Production.” Bei Persistent Systems leitet Dattaraj das AI Research Lab, das state-of-the-art-Algorithmen in Computer Vision, Natural Language Understanding, Probabilistic Programming, Reinforcement Learning, Explainable AI usw. erforscht und deren Anwendbarkeit in den Bereichen Gesundheitswesen, Banking und Industrie demonstriert. Dattaraj hält 11 Patente im Bereich Machine Learning und Computer Vision.