AGI und Zukunft der KI

Der Aufstieg der domänenspezifischen Sprachmodelle

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Einleitung

Das Feld der natürlichen Sprachverarbeitung (NLP) und Sprachmodelle hat in den letzten Jahren eine bemerkenswerte Transformation erlebt, die durch die Einführung leistungsstarker großer Sprachmodelle (LLMs) wie GPT-4, PaLM und Llama vorangetrieben wurde. Diese Modelle, die auf riesigen Datensätzen trainiert wurden, haben eine beeindruckende Fähigkeit demonstriert, menschliche Texte zu verstehen und zu generieren, und haben damit neue Möglichkeiten in verschiedenen Bereichen eröffnet.

Allerdings ist mit der zunehmenden Verbreitung von KI-Anwendungen in verschiedenen Branchen ein wachsender Bedarf an Sprachmodellen entstanden, die auf spezifische Domänen und ihre einzigartigen sprachlichen Nuancen zugeschnitten sind. Hier kommen die domänenspezifischen Sprachmodelle ins Spiel, eine neue Generation von KI-Systemen, die darauf ausgelegt sind, Sprache innerhalb des Kontexts bestimmter Branchen oder Wissensgebiete zu verstehen und zu generieren. Dieser spezialisierte Ansatz verspricht, die Art und Weise, wie KI mit verschiedenen Branchen interagiert und sie bedient, zu revolutionieren, und die Genauigkeit, Relevanz und praktische Anwendbarkeit von Sprachmodellen zu erhöhen.

Im Folgenden werden wir den Aufstieg der domänenspezifischen Sprachmodelle, ihre Bedeutung, ihre zugrunde liegende Funktionsweise und ihre realen Anwendungen in verschiedenen Branchen erkunden. Wir werden auch über die Herausforderungen und Best Practices sprechen, die mit der Entwicklung und dem Einsatz dieser spezialisierten Modelle verbunden sind, um Ihnen die notwendigen Kenntnisse zu vermitteln, um ihr volles Potenzial auszuschöpfen.

Was sind domänenspezifische Sprachmodelle?

Domänenspezifische Sprachmodelle (DSLMs) sind eine Klasse von KI-Systemen, die darauf spezialisiert sind, Sprache innerhalb des Kontexts einer bestimmten Domäne oder Branche zu verstehen und zu generieren. Im Gegensatz zu allgemeinen Sprachmodellen, die auf diversen Datensätzen trainiert werden, werden DSLMs feinjustiert oder von Grund auf auf domänenspezifischen Daten trainiert, um sie in die Lage zu versetzen, Sprache zu verstehen und zu generieren, die auf die einzigartige Terminologie, Jargon und sprachlichen Muster der jeweiligen Domäne zugeschnitten ist.

Diese Modelle sind darauf ausgelegt, die Lücke zwischen allgemeinen Sprachmodellen und den spezifischen Sprachanforderungen verschiedener Branchen zu schließen, wie z.B. der Rechtsbranche, der Finanzbranche, der Gesundheitsbranche und der wissenschaftlichen Forschung. Durch die Nutzung von domänenspezifischem Wissen und kontextuellem Verständnis können DSLMs genauere und relevantere Ausgaben liefern, was die Effizienz und Anwendbarkeit von KI-gesteuerten Lösungen in diesen Domänen erhöht.

Hintergrund und Bedeutung von DSLMs

Die Ursprünge von DSLMs liegen in den Grenzen allgemeiner Sprachmodelle, wenn sie auf domänenspezifische Aufgaben angewendet werden. Während diese Modelle hervorragend darin sind, natürliche Sprache im Allgemeinen zu verstehen und zu generieren, kämpfen sie oft mit den Nuancen und Komplexitäten spezifischer Domänen, was zu potenziellen Ungenauigkeiten oder Fehlinterpretationen führen kann.

Als KI-Anwendungen zunehmend in verschiedene Branchen eindrangen, wuchs der Bedarf an auf bestimmte Domänen zugeschnittenen Sprachmodellen, die effektiv innerhalb dieser Domänen kommunizieren und verstehen können. Dieser Bedarf, kombiniert mit der Verfügbarkeit großer domänenspezifischer Datensätze und Fortschritten in der natürlichen Sprachverarbeitung, ebnete den Weg für die Entwicklung von DSLMs.

Die Bedeutung von DSLMs liegt in ihrer Fähigkeit, die Genauigkeit, Relevanz und praktische Anwendbarkeit von KI-gesteuerten Lösungen in spezifischen Domänen zu erhöhen. Durch die genaue Interpretation und Generierung von domänenspezifischer Sprache können diese Modelle eine effektivere Kommunikation, Analyse und Entscheidungsfindung ermöglichen, was letztendlich zu erhöhter Effizienz und Produktivität in verschiedenen Branchen führt.

Wie funktionieren domänenspezifische Sprachmodelle?

DSLMs werden typischerweise auf der Grundlage großer Sprachmodelle aufgebaut, die auf riesigen allgemeinen Textdatensätzen trainiert wurden. Der entscheidende Unterschied liegt jedoch im Feinjustierungs- oder Retrainingsprozess, bei dem diese Modelle auf domänenspezifischen Datensätzen weiter trainiert werden, um sie auf die Sprachmuster, Terminologie und Kontext bestimmter Branchen zu spezialisieren.

Es gibt zwei primäre Ansätze zur Entwicklung von DSLMs:

  1. Feinjustierung bestehender Sprachmodelle: Bei diesem Ansatz wird ein vorgefertigtes allgemeines Sprachmodell auf domänenspezifischen Daten feinjustiert. Die Gewichte des Modells werden angepasst und optimiert, um die sprachlichen Muster und Nuancen der Ziel-Domäne zu erfassen. Dieser Ansatz nutzt die bestehenden Kenntnisse und Fähigkeiten des Basis-Modells, während es auf die spezifische Domäne angepasst wird.
  2. Training von Grund auf: Alternativ können DSLMs vollständig von Grund auf trainiert werden, indem sie auf domänenspezifischen Datensätzen trainiert werden. Dieser Ansatz beinhaltet den Aufbau einer Sprachmodell-Architektur und das Training auf einem umfangreichen Korpus von domänenspezifischem Text, um das Modell in die Lage zu versetzen, die Feinheiten der Sprache der Domäne direkt aus den Daten zu lernen.

Unabhängig vom Ansatz beinhaltet der Trainingsprozess für DSLMs die Exposition des Modells gegenüber großen Mengen an domänenspezifischen Textdaten, wie z.B. akademischen Artikeln, Rechtsdokumenten, Finanzberichten oder medizinischen Aufzeichnungen. Fortgeschrittene Techniken wie Transfer Learning, Retrieval-Augmented Generation und Prompt-Engineering werden oft eingesetzt, um die Leistung des Modells zu verbessern und es an die Ziel-Domäne anzupassen.

Reale Anwendungen von domänenspezifischen Sprachmodellen

Der Aufstieg von DSLMs hat eine Vielzahl von Anwendungen in verschiedenen Branchen ermöglicht, die Art und Weise, wie KI mit spezifischen Domänen interagiert und sie bedient, revolutionierend. Hier sind einige bemerkenswerte Beispiele:

Rechtsdomäne

Law LLM Assistant SaulLM-7B

Law LLM Assistant SaulLM-7B

Equall.ai, ein KI-Unternehmen, hat kürzlich SaulLM-7B vorgestellt, das erste Open-Source-Groß-Sprachmodell, das explizit für die Rechtsdomäne entwickelt wurde.

Die Rechtsbranche stellt für Sprachmodelle eine einzigartige Herausforderung dar, da sie eine komplexe Syntax, spezielle Vokabular und domänenspezifische Nuancen aufweist. Rechtstexte wie Verträge, Gerichtsentscheidungen und Gesetze sind durch eine besondere sprachliche Komplexität gekennzeichnet, die ein tiefes Verständnis des Rechtskontexts und der Terminologie erfordert.

SaulLM-7B ist ein 7-Milliarden-Parameter-Sprachmodell, das darauf ausgelegt ist, die Hürde der Rechtssprache zu überwinden. Der Entwicklungsprozess des Modells umfasst zwei kritische Stadien:

  1. Rechtliche Weiterbildung: Die Grundlage von SaulLM-7B bildet die Mistral-7B-Architektur, ein leistungsstarkes Open-Source-Sprachmodell. Die Entwickler von Equall.ai erkannten jedoch die Notwendigkeit einer speziellen Ausbildung, um die rechtlichen Fähigkeiten des Modells zu verbessern. Dazu haben sie einen umfangreichen Korpus von Rechtstexten mit über 30 Milliarden Token aus verschiedenen Rechtsordnungen zusammengestellt, darunter die USA, Kanada, Großbritannien, Europa und Australien.

Durch die Exposition des Modells gegenüber diesem umfangreichen und vielfältigen Rechtsdatensatz während der Weiterbildungsphase entwickelte SaulLM-7B ein tiefes Verständnis der Nuancen und Komplexitäten der Rechtssprache. Dieser Ansatz ermöglichte es dem Modell, die einzigartigen sprachlichen Muster, Terminologien und Kontexte der Rechtsdomäne zu erfassen, was seine außergewöhnliche Leistung in Rechtsaufgaben ermöglichte.

  1. Rechtliche Anweisungen Feinjustierung: Während die Weiterbildung auf Rechtsdaten von entscheidender Bedeutung ist, reicht sie oft nicht aus, um eine nahtlose Interaktion und Aufgabenerfüllung für Sprachmodelle zu ermöglichen. Um diese Herausforderung zu meistern, haben die Entwickler von Equall.ai eine neuartige Feinjustierungsmethode eingesetzt, die Rechtsdaten nutzt, um die Fähigkeiten von SaulLM-7B weiter zu verfeinern.

Der Feinjustierungsprozess umfasste zwei Schlüsselkomponenten: allgemeine Anweisungen und rechtliche Anweisungen.

Als SaulLM-7B auf dem LegalBench-Instruct-Benchmark, einer umfassenden Suite von Rechtsaufgaben, getestet wurde, etablierte die feinjustierte Variante SaulLM-7B-Instruct einen neuen Stand der Technik und übertraf das beste Open-Source-Instruct-Modell um 11%.

Darüber hinaus zeigte eine detaillierte Analyse der Leistung von SaulLM-7B-Instruct, dass es in vier Kernbereichen der Rechtsexpertise hervorragende Fähigkeiten besitzt: Issue-Spotting, Rule-Recall, Interpretation und Rhetorik-Verständnis. Diese Bereiche erfordern ein tiefes Verständnis von Rechtskenntnissen, und die Dominanz von SaulLM-7B-Instruct in diesen Domänen ist ein Zeichen für die Kraft seiner spezifischen Ausbildung.

Die Auswirkungen des Erfolgs von SaulLM-7B reichen weit über akademische Benchmarks hinaus. Durch die Überbrückung der Lücke zwischen der natürlichen Sprachverarbeitung und der Rechtsdomäne hat dieses Pioniermodell das Potenzial, die Art und Weise, wie Rechtsanwälte komplexe Rechtsmaterialien navigieren und interpretieren, zu revolutionieren.

Biomedizin und Gesundheitswesen

GatorTron, Codex-Med, Galactica, and Med-PaLM LLM

GatorTron, Codex-Med, Galactica, and Med-PaLM LLM

Während allgemeine LLMs bemerkenswerte Fähigkeiten bei der Verständigung und Generierung natürlicher Sprache gezeigt haben, erfordern die Komplexitäten und Nuancen medizinischer Terminologie, klinischer Notizen und gesundheitsbezogener Inhalte spezielle Modelle, die auf relevanten Daten trainiert wurden.

An der Spitze dieser Entwicklung stehen Initiativen wie GatorTron, Codex-Med, Galactica und Med-PaLM, die alle bedeutende Fortschritte bei der Entwicklung von LLMs für Gesundheitsanwendungen gemacht haben.

GatorTron: Der Wegbereiter für klinische LLMs GatorTron, ein früher Eintritt in das Feld der Gesundheits-LLMs, wurde entwickelt, um zu untersuchen, wie Systeme, die unstrukturierte elektronische Gesundheitsakten (EHRs) verwenden, von klinischen LLMs mit Milliarden von Parametern profitieren könnten. Trainiert von Grund auf mit über 90 Milliarden Token, einschließlich mehr als 82 Milliarden Wörtern von anonymisierten klinischen Texten, zeigte GatorTron bedeutende Verbesserungen bei verschiedenen klinischen NLP-Aufgaben, wie z.B. klinischer Konzeptextraktion, medizinischer Beziehungsextraktion, semantischer Textähnlichkeit, medizinischer Sprachinferenz und medizinischer Fragebeantwortung.

Codex-Med: Erforschung von GPT-3 für medizinische Fragebeantwortung Während Codex-Med kein neues LLM einführt, untersuchte die Studie die Effektivität von GPT-3.5-Modellen, insbesondere Codex und InstructGPT, bei der Beantwortung und Begründung von realen medizinischen Fragen. Durch die Nutzung von Techniken wie Chain-of-Thought-Prompting und Retrieval-Augmentation erreichte Codex-Med eine Leistung auf menschlichem Niveau bei Benchmarks wie USMLE, MedMCQA und PubMedQA. Diese Studie hob das Potenzial von allgemeinen LLMs für medizinische Fragebeantwortungsaufgaben mit geeigneter Prompting und Augmentation hervor.

Galactica: Ein speziell entwickeltes LLM für wissenschaftliches Wissen Galactica, entwickelt von Anthropic, ragt als ein speziell entwickeltes LLM hervor, das darauf abzielt, wissenschaftliches Wissen zu speichern, zu kombinieren und zu begründen, einschließlich des Gesundheitswesens. Im Gegensatz zu anderen LLMs, die auf unkuratierten Webdaten trainiert wurden, besteht das Trainingskorpus von Galactica aus 106 Milliarden Token aus hochwertigen Quellen wie Artikeln, Referenzmaterialien und Enzyklopädien. Bei der Bewertung von Aufgaben wie PubMedQA, MedMCQA und USMLE zeigte Galactica beeindruckende Ergebnisse und übertraf die Leistung von State-of-the-Art-Modellen auf mehreren Benchmarks.

Med-PaLM: Anpassung von Sprachmodellen an die medizinische Domäne Med-PaLM, eine Variante des leistungsstarken PaLM-LLMs, nutzt einen neuen Ansatz namens Anweisungs-Prompt-Tuning, um Sprachmodelle an die medizinische Domäne anzupassen. Durch die Verwendung eines weichen Prompts als Initialpräfix, gefolgt von aufgabenbezogenen, von Menschen erstellten Prompts und Beispielen, erreichte Med-PaLM beeindruckende Ergebnisse auf Benchmarks wie MultiMedQA, das Datensätze wie LiveQA TREC 2017, MedicationQA, PubMedQA, MMLU, MedMCQA, USMLE und HealthSearchQA umfasst.

Trotz dieser Fortschritte stehen die Entwicklung und der Einsatz von Gesundheits-LLMs vor mehreren Herausforderungen. Die Sicherstellung der Datenqualität, die Bewältigung potenzieller Voreingenommenheit und die Einhaltung strenger Datenschutz- und Sicherheitsstandards für sensible medizinische Daten sind die Hauptanliegen.

Darüber hinaus erfordert die Komplexität des medizinischen Wissens und die hohe Einschlägigkeit, die mit Gesundheitsanwendungen verbunden ist, strenge Bewertungsrahmen und menschliche Bewertungsprozesse. Die Med-PaLM-Studie führte einen umfassenden Rahmen für die menschliche Bewertung ein, der Aspekte wie wissenschaftliche Konsens, Beweis für korrekte Begründung und die Möglichkeit von Schaden bewertet, und hob damit die Bedeutung solcher Rahmen für die Schaffung sicherer und vertrauenswürdiger LLMs hervor.

Finanz und Bankwesen

Finance LLM

Finance LLM

In der Welt der Finanzen, in der Präzision und informierte Entscheidungen von entscheidender Bedeutung sind, kündigt das Auftauchen von Finanz-LLMs eine transformative Ära an. Diese Modelle, die darauf ausgelegt sind, finanzspezifische Inhalte zu verstehen und zu generieren, sind für Aufgaben von der Sentiment-Analyse bis hin zu komplexen Finanzberichten konzipiert.

Finanz-LLMs wie BloombergGPT, FinBERT und FinGPT nutzen spezielle Trainings auf umfangreichen finanzbezogenen Datensätzen, um bemerkenswerte Genauigkeit bei der Analyse von Finanztexten, der Verarbeitung von Daten und der Bereitstellung von Erkenntnissen zu erzielen, die Expertenanalysen entsprechen.

Diese Modelle sind nicht nur von entscheidender Bedeutung für die Automatisierung von Routine-Finanzanalysen und -berichten, sondern auch für komplexe Aufgaben wie Betrugsbekämpfung, Risikomanagement und algorithmisches Trading. Die Integration von Retrieval-Augmented Generation (RAG) mit diesen Modellen verleiht ihnen die Fähigkeit, zusätzliche Finanzdatenquellen zu nutzen, was ihre analytischen Fähigkeiten erweitert.

Die Entwicklung und Feinjustierung dieser Finanz-LLMs, um domänen-spezifische Expertise zu erzielen, erfordert jedoch erhebliche Investitionen, was sich in der relativ geringen Verfügbarkeit solcher Modelle auf dem Markt widerspiegelt. Trotz der Kosten und der Knappheit dienen Modelle wie FinBERT und FinGPT, die der Öffentlichkeit zugänglich sind, als wichtige Schritte auf dem Weg zur Demokratisierung von KI in der Finanzbranche.

FinGPT und ähnliche Modelle sind durch Feinjustierungsstrategien wie Standard- und Anweisungs-Methoden in der Lage, präzise und kontextuell relevante Ausgaben zu liefern, was die Revolutionierung von Finanzberatung, Vorhersage und Compliance-Überwachung ermöglichen könnte.

Für eine umfassende Übersicht über die transformative Rolle von generativer KI in der Finanzbranche, einschließlich Einblicken in FinGPT, BloombergGPT und deren Auswirkungen auf die Branche, empfehlen wir die detaillierte Analyse im Artikel “Generative KI in der Finanzbranche: FinGPT, BloombergGPT und darüber hinaus“.

Software-Entwicklung und Programmierung

software and programming llm

Software and programming LLM

In der Landschaft der Software-Entwicklung und Programmierung sind Large Language Models (LLMs) wie OpenAI’s Codex und Tabnine als transformative Werkzeuge aufgetaucht. Diese Modelle bieten Entwicklern eine natürliche Sprachoberfläche und mehrsprachige Fähigkeiten, die es ihnen ermöglichen, Code mit unvergleichlicher Effizienz zu schreiben und zu übersetzen.

OpenAI Codex ragt durch seine natürliche Sprachoberfläche und mehrsprachige Fähigkeiten in verschiedenen Programmiersprachen hervor, wodurch ein verbesserter Code-Verständnis ermöglicht wird. Sein Abonnement-Modell ermöglicht flexible Nutzung.

Tabnine verbessert den Codierungsprozess durch intelligente Code-Vervollständigung und bietet eine kostenlose Version für Einzelbenutzer sowie skalierbare Abonnement-Optionen für professionelle und Unternehmensbedürfnisse.

Für den Offline-Einsatz bietet das Modell von Mistral AI eine überlegene Leistung bei Codierungsaufgaben im Vergleich zu Llama-Modellen, was es zu einer optimalen Wahl für die lokale LLM-Implementierung macht, insbesondere für Benutzer mit spezifischen Leistungs- und Hardware-Ressourcen-Anforderungen.

Cloud-basierte LLMs wie Gemini Pro und GPT-4 bieten ein breites Spektrum an Fähigkeiten, wobei Gemini Pro multimodale Funktionalitäten bietet und GPT-4 bei komplexen Aufgaben hervorragt. Die Wahl zwischen lokaler und Cloud-Implementierung hängt von Faktoren wie Skalierungsbedarf, Datenschutzanforderungen, Kostenbeschränkungen und Benutzerfreundlichkeit ab.

Pieces Copilot verkörpert diese Flexibilität, indem es Zugang zu einer Vielzahl von LLM-Laufzeiten bietet, sowohl Cloud-basiert als auch lokal, um sicherzustellen, dass Entwickler die richtigen Werkzeuge haben, um ihre Codierungsaufgaben zu unterstützen, unabhängig von den Projektanforderungen. Dazu gehören die neuesten Angebote von OpenAI und Google’s Gemini-Modellen, die jeweils für spezifische Aspekte der Software-Entwicklung und Programmierung konzipiert sind.

Herausforderungen und Best Practices

Während das Potenzial von DSLMs enorm ist, kommen ihre Entwicklung und Implementierung mit einzigartigen Herausforderungen, die angegangen werden müssen, um ihre erfolgreiche und verantwortungsvolle Umsetzung zu gewährleisten.

  1. Datenverfügbarkeit und -qualität: Die Beschaffung hochwertiger, domänenspezifischer Datensätze ist entscheidend für die Ausbildung genauer und zuverlässiger DSLMs. Probleme wie Datenknappheit, Voreingenommenheit und Rauschen können die Modellleistung erheblich beeinträchtigen.
  2. Rechenressourcen: Das Training großer Sprachmodelle, insbesondere von Grund auf, kann rechenintensiv sein und erhebliche Rechenressourcen und spezialisierte Hardware erfordern.
  3. Domänen-Expertise: Die Entwicklung von DSLMs erfordert die Zusammenarbeit zwischen KI-Experten und Domänen-Spezialisten, um die genaue Darstellung von domänen-spezifischem Wissen und sprachlichen Mustern zu gewährleisten.
  4. Ethische Überlegungen: Wie bei jedem KI-System müssen DSLMs unter strengen ethischen Richtlinien entwickelt und implementiert werden, wobei Aspekte wie Voreingenommenheit, Datenschutz und Transparenz berücksichtigt werden müssen.

Um diese Herausforderungen zu meistern und die verantwortungsvolle Entwicklung und Implementierung von DSLMs zu gewährleisten, ist es entscheidend, Best Practices zu verfolgen, darunter:

  • Die Kuratierung hochwertiger domänenspezifischer Datensätze und die Anwendung von Techniken wie Daten-Augmentation und Transfer-Learning, um Datenknappheit zu überwinden.
  • Die Nutzung von verteilten Rechenressourcen und Cloud-Ressourcen, um die rechenintensiven Anforderungen des Trainings großer Sprachmodelle zu bewältigen.
  • Die Förderung interdisziplinärer Zusammenarbeit zwischen KI-Forschern, Domänen-Experten und Stakeholdern, um die genaue Darstellung von Domänen-Wissen und die Ausrichtung auf Branchen-Bedürfnisse zu gewährleisten.
  • Die Implementierung robuster Bewertungsrahmen und kontinuierlicher Überwachung, um die Modellleistung zu bewerten, Voreingenommenheit zu identifizieren und die ethische und verantwortungsvolle Implementierung zu gewährleisten.
  • Die Einhaltung branchenspezifischer Vorschriften und Richtlinien, wie z.B. HIPAA für das Gesundheitswesen oder DSGVO für den Datenschutz, um Compliance und den Schutz sensibler Informationen zu gewährleisten.

Fazit

Der Aufstieg von domänenspezifischen Sprachmodellen markiert einen bedeutenden Meilenstein in der Evolution von KI und ihrer Integration in spezifische Domänen. Durch die Anpassung von Sprachmodellen an die einzigartigen sprachlichen Muster und Kontexte verschiedener Branchen haben DSLMs das Potenzial, die Art und Weise, wie KI mit diesen Domänen interagiert und sie bedient, zu revolutionieren, und die Genauigkeit, Relevanz und praktische Anwendbarkeit von KI-gesteuerten Lösungen in diesen Domänen zu erhöhen.

Da KI-Anwendungen weiterhin in verschiedene Branchen eindringen, wird die Nachfrage nach DSLMs nur steigen, was weitere Fortschritte und Innovationen in diesem Bereich vorantreiben wird. Durch die Bewältigung der Herausforderungen und die Verfolgung von Best Practices können Organisationen und Forscher das volle Potenzial dieser spezialisierten Sprachmodelle nutzen und neue Grenzen in domänen-spezifischen KI-Anwendungen erschließen.

Die Zukunft von KI liegt in ihrer Fähigkeit, innerhalb der Nuancen spezifischer Domänen zu verstehen und zu kommunizieren, und domänenspezifische Sprachmodelle sind der Schlüssel zu einer kontextuell angemesseneren, genauereren und wirksameren Integration von KI in verschiedene Branchen.

Ich habe die letzten fünf Jahre damit verbracht, mich in die faszinierende Welt des Machine Learning und Deep Learning zu vertiefen. Mein Engagement und meine Expertise haben mich dazu geführt, an über 50 verschiedenen Software-Entwicklungsprojekten mit einem besonderen Fokus auf AI/ML beizutragen. Meine anhaltende Neugier hat mich auch zum Bereich der Natural Language Processing hingezogen, einem Feld, das ich weiter erforschen möchte.