AGI und Zukunft der KI

Große Aktionsmodelle (LAMs): Die nächste Frontier in AI-gesteuerter Interaktion

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Fast ein Jahr ago, sagte Mustafa Suleyman, Mitgründer von DeepMind, voraus, dass die Ära der generativen KI bald von etwas Interaktiverem abgelöst werden würde: Systemen, die in der Lage sind, Aufgaben durch Interaktion mit Software-Anwendungen und menschlichen Ressourcen auszuführen. Heute sehen wir diese Vision beginnen, sich mit der Entwicklung von Rabbit AI‘s neuem KI-gesteuertem Betriebssystem, R1, zu verwirklichen. Dieses System hat eine beeindruckende Fähigkeit gezeigt, menschliche Interaktionen mit Anwendungen zu überwachen und zu imitieren. Im Herzen von R1 liegt das Große Aktionsmodell (LAM), ein fortschrittlicher KI-Assistent, der darauf programmiert ist, Benutzerabsichten zu verstehen und Aufgaben in ihrem Auftrag auszuführen. Während es früher unter anderen Begriffen wie Interaktive KI und Großes Agens-Modell bekannt war, gewinnt das Konzept von LAMs an Momentum als eine wichtige Innovation in KI-gesteuerter Interaktion. Dieser Artikel erforscht die Details von LAMs, wie sie sich von traditionellen Großen Sprachmodellen (LLMs) unterscheiden, stellt Rabbit AI’s R1-System vor und betrachtet, wie Apple (AAPL ) auf einen LAM-ähnlichen Ansatz zusteuert. Er diskutiert auch die potenziellen Anwendungen von LAMs und die Herausforderungen, denen sie gegenüberstehen.

Verständnis von Großen Aktions- oder Agens-Modellen (LAMs)

Ein LAM ist ein fortschrittlicher KI-Agent, der darauf programmiert ist, menschliche Absichten zu erfassen und spezifische Ziele auszuführen. Diese Modelle sind hervorragend darin, menschliche Bedürfnisse zu verstehen, komplexe Aufgaben zu planen und mit verschiedenen Modellen, Anwendungen oder Menschen zu interagieren, um ihre Pläne auszuführen. LAMs gehen über einfache KI-Aufgaben wie die Generierung von Antworten oder Bildern hinaus; sie sind vollständige Systeme, die darauf ausgelegt sind, komplexe Aktivitäten wie Reiseplanung, Terminplanung und E-Mail-Management zu bewältigen. Zum Beispiel würde bei der Reiseplanung ein LAM mit einer Wetter-App für Vorhersagen interagieren, mit Flugbuchungsdiensten um geeignete Flüge zu finden und mit Hotelbuchungssystemen, um Unterkünfte zu sichern. Im Gegensatz zu vielen traditionellen KI-Modellen, die sich ausschließlich auf Neuronale Netze verlassen, nutzen LAMs einen hybriden Ansatz, der Neuro-Symbolische Programmierung kombiniert. Diese Integration von Symbolischer Programmierung hilft bei logischem Denken und Planung, während Neuronale Netze zur Erkennung komplexer sensorischer Muster beitragen. Diese Kombination ermöglicht es LAMs, ein breites Spektrum von Aufgaben zu bewältigen, was sie als eine nuancierte Entwicklung in KI-gesteuerter Interaktion kennzeichnet.

Vergleich von LAMs mit LLMs

Im Gegensatz zu LAMs sind LLMs KI-Agenten, die darauf programmiert sind, Benutzeranweisungen zu interpretieren und textbasierte Antworten zu generieren, hauptsächlich bei Aufgaben, die Sprachverarbeitung beinhalten. Ihre Reichweite ist jedoch in der Regel auf textbezogene Aktivitäten beschränkt. Andererseits erweitern LAMs die Fähigkeiten von KI über die Sprache hinaus, sodass sie komplexe Aktionen ausführen können, um spezifische Ziele zu erreichen. Zum Beispiel könnte ein LLM effektiv eine E-Mail basierend auf Benutzeranweisungen erstellen, während ein LAM nicht nur die E-Mail erstellt, sondern auch den Kontext versteht, über die geeignete Antwort entscheidet und die Zustellung der E-Mail verwaltet.

Darüber hinaus sind LLMs in der Regel darauf ausgelegt, das nächste Token in einer Textfolge vorherzusagen und schriftliche Anweisungen auszuführen. Im Gegensatz dazu sind LAMs nicht nur mit Sprachverständnis ausgestattet, sondern auch mit der Fähigkeit, mit verschiedenen Anwendungen und realen Systemen wie IoT-Geräten zu interagieren. Sie können physische Aktionen ausführen, Geräte steuern und Aufgaben bewältigen, die die Interaktion mit der externen Umgebung erfordern, wie zum Beispiel die Buchung von Terminen oder die Vorbestellung von Tischen. Diese Kombination von Sprachfähigkeiten mit praktischer Ausführung ermöglicht es LAMs, in vielfältigeren Szenarien zu operieren als LLMs.

LAMs in Aktion: Das Rabbit R1

Das Rabbit R1 ist ein prominentes Beispiel für LAMs in der Praxis. Dieses KI-gesteuerte Gerät kann mehrere Anwendungen über eine einzige, benutzerfreundliche Oberfläche verwalten. Ausgestattet mit einem 2,88-Zoll-Touchscreen, einer drehbaren Kamera und einem Scrollrad, ist das R1 in einem schlanken, runden Gehäuse unter Mitarbeit von Teenage Engineering untergebracht. Es läuft auf einem 2,3-GHz-MediaTek-Prozessor, der von 4 GB Arbeitsspeicher und 128 GB Speicher unterstützt wird.

Im Herzen des R1 liegt sein LAM, das intelligenterweise die Funktionalitäten von Apps überwacht und komplexe Aufgaben wie die Steuerung von Musik, die Buchung von Transportmitteln, den Kauf von Lebensmitteln und das Versenden von Nachrichten aus einer einzigen Interaktionsstelle heraus vereinfacht. Auf diese Weise eliminiert das R1 die Mühe, zwischen mehreren Apps oder mehreren Anmeldungen zu wechseln, um diese Aufgaben auszuführen.

Das LAM im R1 wurde ursprünglich durch die Beobachtung von menschlichen Interaktionen mit beliebten Apps wie Spotify und Uber trainiert. Diese Ausbildung hat es dem LAM ermöglicht, Benutzeroberflächen zu navigieren, Symbole zu erkennen und Transaktionen zu verarbeiten. Diese umfassende Ausbildung ermöglicht es dem R1, sich nahtlos an fast jede Anwendung anzupassen. Darüber hinaus ermöglicht ein spezieller Trainingsmodus den Benutzern, neue Aufgaben einzuführen und zu automatisieren, wodurch die Fähigkeiten des R1 kontinuierlich erweitert werden und es zu einem dynamischen Werkzeug in der Welt der KI-gesteuerten Interaktionen wird.

Apples Fortschritte bei LAM-inspirierten Fähigkeiten in Siri

Apples KI-Forschungsteam hat kürzlich Einblicke in ihre Bemühungen geteilt, Siris Fähigkeiten durch eine neue Initiative zu verbessern, die denen von LAMs ähnelt. Die Initiative, in einem Forschungspapier über Reference Resolution As Language Modeling (ReALM) beschrieben, zielt darauf ab, Siris Fähigkeit zur Verständigung von konversationellem Kontext, visuellem Inhalt auf dem Bildschirm und Umgebungsaktivitäten zu verbessern. Der Ansatz, den ReALM bei der Verarbeitung von Benutzeroberflächen-Eingaben verfolgt, ähnelt den Funktionalitäten, die bei Rabbit AI’s R1 beobachtet werden, und zeigt Apples Absicht, Siris Verständnis von Benutzerinteraktionen zu verbessern.

Diese Entwicklung deutet darauf hin, dass Apple die Übernahme von LAM-Technologien in Betracht zieht, um die Interaktionen zwischen Benutzern und Geräten zu verfeinern. Obwohl es keine expliziten Ankündigungen über die Bereitstellung von ReALM gibt, deutet das Potenzial für eine signifikante Verbesserung von Siris Interaktion mit Apps auf vielversprechende Fortschritte in der Entwicklung von intuitiveren und responsiveren Assistenten hin.

Potenzielle Anwendungen von LAMs

LAMs haben das Potenzial, ihre Wirkung weit über die Verbesserung von Interaktionen zwischen Benutzern und Geräten hinaus auszudehnen; sie könnten erhebliche Vorteile in verschiedenen Branchen bieten.   

  • Kundenservice: LAMs können den Kundenservice verbessern, indem sie Anfragen und Beschwerden unabhängig über verschiedene Kanäle bearbeiten. Diese Modelle können Anfragen mithilfe der natürlichen Sprache verarbeiten, Lösungen automatisieren und Termine verwalten, um personalisierten Service basierend auf der Kundenhistorie zu bieten, um die Zufriedenheit zu verbessern.
  • Gesundheitswesen: Im Gesundheitswesen können LAMs helfen, die Patientenversorgung zu verwalten, indem sie Termine organisieren, Medikamente verwalten und die Kommunikation zwischen Diensten erleichtern. Sie sind auch nützlich für die Fernüberwachung, die Interpretation von medizinischen Daten und die Warnung des Personals in Notfällen, insbesondere bei der Betreuung von chronisch Kranken und älteren Menschen.
  • Finanzen: LAMs können personalisierte Finanzberatung anbieten und Aufgaben wie Portfolioausgleich und Anlagevorschläge verwalten. Sie können auch Transaktionen überwachen, um Betrug zu erkennen und zu verhindern, und sich nahtlos in Bankensysteme integrieren, um verdächtige Aktivitäten schnell anzusprechen.

Herausforderungen von LAMs

Trotz ihres erheblichen Potenzials stoßen LAMs auf mehrere Herausforderungen, die angegangen werden müssen.

  • Datenschutz und Sicherheit: Angesichts des umfassenden Zugriffs auf persönliche und sensible Informationen, die LAMs benötigen, um zu funktionieren, ist die Gewährleistung von Datenschutz und Sicherheit eine große Herausforderung. LAMs interagieren mit persönlichen Daten über mehrere Anwendungen und Plattformen hinweg, was Bedenken hinsichtlich der sicheren Handhabung, Speicherung und Verarbeitung dieser Informationen aufwirft.
  • Ethische und regulatorische Bedenken: Da LAMs autonomere Rollen in Entscheidungsprozessen und Interaktionen mit menschlichen Umgebungen übernehmen, werden ethische Überlegungen immer wichtiger. Fragen zur Rechenschaftspflicht, Transparenz und dem Umfang der an Maschinen delegierten Entscheidungen sind von entscheidender Bedeutung. Darüber hinaus können regulatorische Herausforderungen bei der Bereitstellung solcher fortschrittlicher KI-Systeme in verschiedenen Branchen auftreten.
  • Komplexität der Integration: LAMs erfordern die Integration mit einer Vielzahl von Software- und Hardware-Systemen, um Aufgaben effektiv auszuführen. Diese Integration ist komplex und kann schwierig zu verwalten sein, insbesondere wenn Aktionen über verschiedene Plattformen und Dienste koordiniert werden, wie bei der Buchung von Flügen, Unterkünften und anderen logistischen Details in Echtzeit.
  • Skalierbarkeit und Anpassungsfähigkeit: Obwohl LAMs darauf ausgelegt sind, sich an eine breite Palette von Szenarien und Anwendungen anzupassen, bleibt die Skalierung dieser Lösungen, um konsistent und effizient in realen Umgebungen zu funktionieren, eine Herausforderung. Es ist entscheidend, sicherzustellen, dass LAMs sich an veränderte Bedingungen anpassen und ihre Leistung über verschiedene Aufgaben und Benutzerbedürfnisse hinweg aufrechterhalten können.

Das Fazit

Große Aktionsmodelle (LAMs) sind als eine bedeutende Innovation in der KI-Entwicklung im Kommen, die nicht nur die Interaktion mit Geräten, sondern auch breitere Branchenanwendungen beeinflusst. Wie durch Rabbit AI’s R1 und Apples Fortschritte bei Siri demonstriert, bereiten LAMs den Boden für interaktivere und intuitivere KI-Systeme. Diese Modelle sind darauf vorbereitet, die Effizienz und Personalisierung in Branchen wie Kundenservice, Gesundheitswesen und Finanzen zu verbessern.

Dennoch ist die Bereitstellung von LAMs mit Herausforderungen verbunden, darunter Datenschutzbedenken, ethische Fragen, Integrationskomplexität und Skalierbarkeit. Es ist entscheidend, diese Probleme anzugehen, während wir auf eine breitere Übernahme von LAM-Technologien zusteuern, um ihre Fähigkeiten verantwortungsvoll und effektiv zu nutzen. Da LAMs weiterentwickelt werden, bleibt ihr Potenzial, digitale Interaktionen zu verändern, erheblich, was ihre Bedeutung in der zukünftigen KI-Landschaft unterstreicht.

Dr. Tehseen Zia ist ein fest angestellter Associate Professor an der COMSATS University Islamabad, der einen PhD in KI von der Vienna University of Technology, Österreich, besitzt. Er spezialisiert sich auf künstliche Intelligenz, Machine Learning, Data Science und Computer Vision und hat mit Veröffentlichungen in renommierten wissenschaftlichen Zeitschriften wesentliche Beiträge geleistet. Dr. Tehseen hat auch verschiedene industrielle Projekte als Principal Investigator geleitet und als KI-Berater fungiert.