KI-Modelle und Plattformen
Gemma: Google bringt fortschrittliche KI-Fähigkeiten durch Open Source
Das Feld der künstlichen Intelligenz (KI) hat in den letzten Jahren enorme Fortschritte gemacht, größtenteils getrieben durch Fortschritte im Deep Learning und der natürlichen Sprachverarbeitung (NLP). An der Spitze dieser Fortschritte stehen große Sprachmodelle (LLM) – KI-Systeme, die auf großen Mengen an Textdaten trainiert wurden und menschliche Texte generieren und an Gesprächsaufgaben teilnehmen können.
LLM wie Google’s PaLM, Anthropic’s Claude und DeepMind’s Gopher haben bemerkenswerte Fähigkeiten demonstriert, von der Codierung bis zur allgemeinen Vernunft. Allerdings wurden die meisten dieser Modelle nicht offen veröffentlicht, was ihren Zugang für Forschung, Entwicklung und nützliche Anwendungen begrenzt.
Dies änderte sich mit der jüngsten Open-Source-Veröffentlichung von Gemma – einer Familie von LLM von Google’s DeepMind, basierend auf ihren leistungsstarken proprietären Gemini-Modellen. In diesem Blog-Beitrag werden wir uns mit Gemma auseinandersetzen, indem wir ihre Architektur, Trainingsprozess, Leistung und verantwortungsvolle Veröffentlichung analysieren.
Überblick über Gemma
Im Februar 2023 veröffentlichte DeepMind open source zwei Größen von Gemma-Modellen – eine 2-Milliarden-Parameter-Version, die für die Verwendung auf Geräten optimiert ist, und eine größere 7-Milliarden-Parameter-Version, die für die Verwendung auf GPU/TPU konzipiert ist.
Gemma nutzt eine ähnliche Transformer-Architektur und Trainingsmethodik wie DeepMind’s führende Gemini-Modelle. Es wurde auf bis zu 6 Billionen Token an Textdaten aus Webdokumenten, Mathematik und Code trainiert.
DeepMind veröffentlichte sowohl rohe vortrainierte Checkpoints von Gemma als auch Versionen, die mit überwachtem Lernen und menschlichem Feedback für verbesserte Fähigkeiten in Bereichen wie Dialog, Anweisungsfolge und Codierung feinjustiert wurden.
Erste Schritte mit Gemma
Gemma’s offene Veröffentlichung macht ihre fortschrittlichen KI-Fähigkeiten für Entwickler, Forscher und Enthusiasten zugänglich. Hier ist eine schnelle Anleitung, um loszulegen:
Plattformunabhängige Bereitstellung
Eine Schlüsseleigenschaft von Gemma ist ihre Flexibilität – Sie können sie auf CPUs, GPUs oder TPUs ausführen. Für CPUs nutzen Sie TensorFlow Lite oder HuggingFace Transformers. Für beschleunigte Leistung auf GPU/TPU verwenden Sie TensorFlow. Cloud-Dienste wie Google Cloud’s Vertex AI bieten auch eine nahtlose Skalierung.
Zugriff auf vortrainierte Modelle
Gemma ist in verschiedenen vortrainierten Varianten verfügbar, je nach Ihren Anforderungen. Die 2B- und 7B-Modelle bieten starke generative Fähigkeiten aus der Box. Für benutzerdefinierte Feinjustierung sind die 2B-FT- und 7B-FT-Modelle ideale Startpunkte.
Aufbau von spannenden Anwendungen
Sie können eine Vielzahl von Anwendungen mit Gemma erstellen, wie z.B. Geschichtenerstellung, Sprachübersetzung, Fragenbeantwortung und kreative Inhaltsproduktion. Der Schlüssel besteht darin, Gemma’s Stärken durch Feinjustierung auf Ihren eigenen Datensätzen zu nutzen.
Architektur
Gemma verwendet eine decoder-only-Transformer-Architektur, die auf Fortschritten wie Multi-Query-Aufmerksamkeit und rotierenden Positionseingaben aufbaut:
- Transformer: Eingeführt im Jahr 2017, ist die Transformer-Architektur, die ausschließlich auf Aufmerksamkeitsmechanismen basiert, in der NLP allgegenwärtig geworden. Gemma erbt die Fähigkeit des Transformers, langfristige Abhängigkeiten in Texten zu modellieren.
- Decoder-only: Gemma verwendet nur einen Transformer-Decoder-Stack, im Gegensatz zu Encoder-Decoder-Modellen wie BART oder T5. Dies bietet starke generative Fähigkeiten für Aufgaben wie Textgenerierung.
- Multi-Query-Aufmerksamkeit: Gemma verwendet Multi-Query-Aufmerksamkeit in ihrem größeren Modell, wodurch jeder Aufmerksamkeitskopf mehrere Anfragen parallel verarbeiten kann, was zu einer schnelleren Inferenz führt.
- Rotierende Positionseingaben: Gemma stellt Positionsinformationen mithilfe rotierender Eingaben dar, anstatt absolute Positionscodierungen zu verwenden. Diese Technik reduziert die Modellgröße, während sie gleichzeitig Positionsinformationen beibehält.
Die Verwendung von Techniken wie Multi-Query-Aufmerksamkeit und rotierenden Positionseingaben ermöglicht es Gemma-Modellen, ein optimales Gleichgewicht zwischen Leistung, Inferenzgeschwindigkeit und Modellgröße zu erreichen.
Daten und Trainingsprozess
Gemma wurde auf bis zu 6 Billionen Token an Textdaten trainiert, hauptsächlich in englischer Sprache. Dazu gehörten Webdokumente, mathematische Texte und Quellcode. DeepMind investierte erhebliche Anstrengungen in die Datenfilterung, um potenziell toxische, illegale oder voreingenommene Texte mithilfe von Klassifizierern und Heuristiken zu entfernen.
Das Training wurde mit Google’s TPUv5-Infrastruktur durchgeführt, wobei bis zu 4096 TPUs für das Training von Gemma-7B verwendet wurden. Effiziente Modell- und Datenparallelisierungstechniken ermöglichten das Training der massiven Modelle mit Standard-Hardware.
Ein gestuftes Training wurde verwendet, wobei die Datenverteilung kontinuierlich angepasst wurde, um sich auf hochwertige, relevante Texte zu konzentrieren. Die finalen Feinjustierungsstadien verwendeten eine Mischung aus menschlich generierten und synthetischen Anweisungsbeispielen, um die Fähigkeiten zu verbessern.
Modellleistung
DeepMind hat Gemma-Modelle sorgfältig auf einer breiten Palette von über 25 Benchmarks ausgewertet, die Fragebeantwortung, Vernunft, Mathematik, Codierung, Allgemeinwissen und Dialogfähigkeiten umfassen.
Gemma erreicht im Vergleich zu ähnlich großen Open-Source-Modellen Spitzenleistungen auf der Mehrheit der Benchmarks. Einige Highlights:
- Mathematik: Gemma übertrifft Modelle wie Codex und Anthropic’s Claude um über 10 Punkte auf mathematischen Vernunfttests wie GSM8K und MATH.
- Codierung: Gemma erreicht oder übertrifft die Leistung von Codex auf Programmierbenchmarks wie MBPP, obwohl es nicht speziell auf Code trainiert wurde.
- Dialog: Gemma zeigt starke konversationelle Fähigkeiten mit 51,7% Sieg gegenüber Anthropic’s Mistral-7B auf menschlichen Präferenztests.
- Vernunft: Bei Aufgaben, die Inferenz erfordern, wie ARC und Winogrande, übertrifft Gemma andere 7B-Modelle um 5-10 Punkte.
Gemma’s Vielseitigkeit über verschiedene Disziplinen hinweg demonstriert ihre starke allgemeine Intelligenz. Obwohl Lücken zur menschlichen Leistung bestehen bleiben, stellt Gemma einen Sprung nach vorne in der Open-Source-NLP dar.
Sicherheit und Verantwortung
Die Veröffentlichung von Open-Source-Gewichten großer Modelle stellt Herausforderungen hinsichtlich vorsätzlicher Missbrauch und inhärenter Modellvoreingenommenheit dar. DeepMind hat Schritte unternommen, um Risiken zu mindern:
- Datenfilterung: Potenziell toxische, illegale oder voreingenommene Texte wurden aus den Trainingsdaten mithilfe von Klassifizierern und Heuristiken entfernt.
- Bewertungen: Gemma wurde auf 30+ Benchmarks getestet, die Sicherheit, Fairness und Robustheit bewerten. Es erreichte oder übertraf andere Modelle.
- Feinjustierung: Die Modellfeinjustierung konzentrierte sich auf die Verbesserung von Sicherheitsfähigkeiten wie Informationsfilterung und angemessenes Verhalten.
- Nutzungsbedingungen: Die Nutzungsbedingungen verbieten die Verwendung von Gemma-Modellen für Anwendungen, die als anstößig, illegal oder unethisch gelten. Die Durchsetzung bleibt jedoch herausfordernd.
- Modellkarten: Karten, die die Modellfähigkeiten, -begrenzungen und -voreingenommenheiten darstellen, wurden veröffentlicht, um Transparenz zu fördern.
Obwohl Risiken durch die Open-Source-Veröffentlichung bestehen, hat DeepMind festgestellt, dass die Veröffentlichung von Gemma nette gesellschaftliche Vorteile aufgrund ihres Sicherheitsprofils und der Ermöglichung von Forschung bietet. Es ist jedoch wichtig, potenzielle Schäden sorgfältig zu überwachen.
Einleitung der nächsten Welle der KI-Innovation
Die Veröffentlichung von Gemma als Open-Source-Modellfamilie kann den Fortschritt in der gesamten KI-Gemeinschaft ermöglichen:
- Zugänglichkeit: Gemma reduziert die Barrieren für Organisationen, um mit fortschrittlicher NLP zu bauen, die zuvor mit hohen Rechen- und Datenkosten für die Ausbildung ihrer eigenen LLM konfrontiert waren.
- Neue Anwendungen: Durch die Veröffentlichung von vortrainierten und feinjustierten Checkpoints ermöglicht DeepMind die einfache Entwicklung von nützlichen Anwendungen in Bereichen wie Bildung, Wissenschaft und Zugänglichkeit.
- Anpassung: Entwickler können Gemma für branchenspezifische oder domänenbezogene Anwendungen durch weitere Ausbildung auf proprietären Daten anpassen.
- Forschung: Offene Modelle wie Gemma fördern eine größere Transparenz und Prüfung der aktuellen NLP-Systeme, die zukünftige Forschungsrichtungen aufzeigen.
- Innovation: Die Verfügbarkeit starker Basismodelle wie Gemma wird den Fortschritt in Bereichen wie Voreingenommenheitsminderung, Tatsächlichkeit und KI-Sicherheit beschleunigen.
Indem DeepMind Gemma’s Fähigkeiten durch Open-Source-Veröffentlichung für alle zugänglich macht, hofft es, die verantwortungsvolle Entwicklung von KI für das Gemeinwohl zu fördern.
Der Weg vor uns
Mit jedem Sprung in der KI kommen wir einem Modell näher, das die menschliche Intelligenz in allen Bereichen übertrifft oder erreicht. Systeme wie Gemma unterstreichen, wie rasche Fortschritte in selbstüberwachten Modellen zunehmend fortschrittliche kognitive Fähigkeiten freisetzen.
Es bleibt jedoch noch Arbeit, um die Zuverlässigkeit, Interpretierbarkeit und Steuerbarkeit von KI zu verbessern – Bereiche, in denen die menschliche Intelligenz noch immer die Oberhand hat. Bereiche wie Mathematik unterstreichen diese anhaltenden Lücken, wobei Gemma 64% auf MMLU erreicht, im Vergleich zu einer geschätzten 89% menschlicher Leistung.
Die Schließung dieser Lücken unter gleichzeitiger Gewährleistung der Sicherheit und Ethik immer leistungsfähigerer KI-Systeme wird die zentrale Herausforderung in den kommenden Jahren sein. Die richtige Balance zwischen Offenheit und Vorsicht wird entscheidend sein, da DeepMind darauf abzielt, den Zugang zu den Vorteilen von KI zu demokratisieren, während es gleichzeitig aufkommende Risiken bewältigt.
Initiativen zur Förderung von KI-Sicherheit – wie Dario Amodei’s ANC, DeepMind’s Ethics & Society-Team und Anthropic’s Constitutional AI – signalisieren eine wachsende Anerkennung dieser Notwendigkeit von Nuancen. Bedeutender Fortschritt wird eine offene, evidenzbasierte Diskussion zwischen Forschern, Entwicklern, politischen Entscheidungsträgern und der Öffentlichkeit erfordern.
Wenn verantwortungsvoll navigiert, stellt Gemma nicht den Gipfel der KI dar, sondern ein Basislager für die nächste Generation von KI-Forschern, die in DeepMind’s Fußstapfen auf dem Weg zu fairer, nützlicher künstlicher allgemeiner Intelligenz folgen.
Schlussfolgerung
Die Veröffentlichung von Gemma-Modellen durch DeepMind markiert eine neue Ära für Open-Source-KI – eine, die über enge Benchmarks hinausgeht und generalisierte Intelligenzfähigkeiten umfasst. Umfassend getestet auf Sicherheit und weitgehend zugänglich, setzt Gemma einen neuen Standard für verantwortungsvolle Open-Source-Veröffentlichung in der KI.
Getrieben von einem wettbewerbsorientierten Geist, der von kooperativen Werten geprägt ist, hebt die Veröffentlichung von Durchbrüchen wie Gemma alle Boote in der KI-Ökonomie an. Die gesamte Gemeinschaft hat jetzt Zugang zu einer vielseitigen LLM-Familie, um ihre Initiativen zu unterstützen oder voranzutreiben.
Obwohl Risiken bestehen, bietet DeepMind’s technische und ethische Sorgfalt die Gewissheit, dass Gemma’s Vorteile ihre potenziellen Schäden überwiegen. Wenn die KI-Fähigkeiten immer fortschrittlicher werden, wird die Aufrechterhaltung dieser Nuancen zwischen Offenheit und Vorsicht entscheidend sein.
Gemma bringt uns einen Schritt näher zu KI, die allen Menschen zugutekommt. Es bleiben jedoch viele große Herausforderungen auf dem Weg zu wohlwollender künstlicher allgemeiner Intelligenz. Wenn KI-Forscher, -Entwickler und die Gesellschaft im Allgemeinen Fortschritte auf kooperative Weise machen können, kann Gemma eines Tages als historisches Basislager und nicht als Endziel angesehen werden.












