KI-Modelle und Plattformen

Eine Einführung in Vertex AI

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Angesichts der sich schnell verändernden Landschaft der künstlichen Intelligenz ist eine der größten Hürden, die Tech-Führer oft überwinden müssen, der Übergang von “experimentell” zu “unternehmensreif”. Während Consumer-Chatbots und interaktive Plattformen die öffentliche Vorstellungskraft unterstützen, können Unternehmen nicht nur mit einer Chat-Schnittstelle erfolgreich sein. In einer Ära, in der der Wettbewerb aggressiver ist als je zuvor, benötigen Unternehmen ein robustes, skalierbares und sicheres Ökosystem, und genau das bietet Google (GOOGL ) mit Vertex AI, der einheitlichen künstlichen Intelligenz- und Machine-Learning-Plattform von Google Cloud.

Vertex AI versucht, sich als Rückgrat für die Integration von Generative AI in moderne Cloud-Infrastrukturen zu etablieren, indem es eine umfassende Suite von Funktionen bietet, die die Lücke zwischen rohen Grundmodellen und produktionsreifen Anwendungen schließt. Vertex AI ist nicht nur ein Wrapper für Large Language Models (LLMs), sondern ein einheitliches Machine-Learning- und künstliches Intelligenz-Ökosystem, das Generative AI als erste Klasse der modernen Cloud-Infrastruktur behandelt.

Im Herzen von Vertex AI befindet sich der Model Garden, ein zentraler Marktplatz, der Zugang zu über 200 kuratierten Grundmodellen bietet, einschließlich des multimodalen Powerhouses Gemini 2.5 Pro, das eine atemberaubende 2-Millionen-Token-Kontextfenster aufweist. In diesem Artikel werden wir die Architektur von Vertex AI zerlegen, erforschen, wie Model Garden als “App Store” für Intelligenz dient, und uns die technischen Säulen ansehen, die diese Plattform zum Rückgrat der nächsten Generation von Unternehmenssoftware machen.

Die Kernarchitektur: Eine Einheitliche Plattform

Vertex AI ist keine lose verkoppelte Sammlung von Tools, sondern ein einheitliches Daten- und AI-Ökosystem, das darauf ausgelegt ist, die Fragmentierung von Daten, Tools und Teams zu überbrücken, die die Maschinenlernen-Entwicklung bis heute behindert. Traditionell findet die AI-Entwicklung in isolierten Umgebungen statt, und manchmal sind die Daten über mehrere Repositorys verteilt. Beispielsweise können Unternehmen Kunden-Daten in SQL-Warenhäusern speichern, während unstrukturierte Dokumente in einem Data Lake abgelegt werden. Wenn Daten in Silos gespeichert sind, sieht die AI nur eine “teilweise Wahrheit”, was zu voreingenommenen Ergebnissen oder hohen Halluzinationsraten führt, da sie den vollen Kontext des Unternehmens nicht hat.

Vertex AI versucht, den gesamten Lebenszyklus zu integrieren, von der Rohdaten-Erfassung in BigQuery und Cloud Storage bis zur Produktionsüberwachung, und dient damit als “Bindegewebe” zwischen diesen Silos. Vertex AI integriert sich nativ mit Cloud Storage und BigQuery, sodass die AI-Modelle die Daten ohne komplexe Extraction-, Transformation- und Load-Pipelines abrufen können.

Die Grundlage: Google’s AI-Hypercomputer

Die GenAI-Schicht von Vertex AI sitzt auf Google’s AI-Hypercomputer-Architektur, einem integrierten Supercomputer-System, das aus folgendem besteht:

TPU v5p & v5e (Tensor Processing Units)

Google’s Tensor Processing Units sind speziell für die Matrixmultiplikation entwickelte ASICs (Application-Specific Integrated Circuits), die die tiefe Lernfähigkeit definieren.

  • TPU v5p (Leistung): Dies ist der Flaggschiff-Beschleuniger für massive Trainings. Jedes TPU-v5p-Modell kann auf 8.960 Chips skalieren, die durch Google’s höchstbandbreiteste Inter-Chip-Interconnect (ICI) mit 4.800 Gbps verbunden sind. Für einen Tech-Leader bedeutet dies 2,8-mal schnellere Trainingszeiten für ein GPT-3-Modell (175 Milliarden Parameter) im Vergleich zur vorherigen Generation, was die Zeit bis zur Markteinführung drastisch reduziert.
  • TPU v5e (Effizienz): Dies ist für “kostenoptimierte” Leistung entwickelt worden. Die v5e ist der Arbeitstier für mittelgroße Trainings und Hochleistungs-Schlußfolgerungen. Sie bietet bis zu 2,5-mal bessere Preis-Leistungs-Verhältnisse, was sie zur idealen Wahl für Unternehmen macht, die 24/7-Schlußfolgerungen ohne großes Budget durchführen müssen.

NVIDIA H100/A100-GPUs für Flexibilität

Während TPUs spezialisiert sind, verlassen sich viele Entwicklungsteams auf das NVIDIA (NVDA ) -CUDA-Ökosystem. Vertex AI bietet erste-Klasse-Unterstützung für NVIDIA’s neueste Hardware:

  • NVIDIA H100 (Hopper): Ideal für das Feintuning der größten Open-Source-Modelle (wie Llama 3.1 405B), die massive Speicherbandbreite erfordern.
  • Jupiter-Netzwerk: Um den “Netzwerk-Flaschenhals” zu vermeiden, verwendet Google sein Jupiter-Rechenzentrums-Netzwerk. Dies stellt sicher, dass Daten zwischen GPUs mit Blitzgeschwindigkeit übertragen werden, wodurch RDMA (Remote Direct Memory Access) den CPU-Overhead umgeht und nahezu lokale Leistung über verteilte Knoten bietet.

Dynamische Orchestrierung

Der wichtigste technische Wandel in Vertex AI ist die dynamische Orchestrierung. In einer Legacy-Umgebung kann ein GPU-Node-Ausfall während eines 3-wöchigen Trainingslaufs den gesamten Job zum Absturz bringen.

  • Automatisierte Widerstandsfähigkeit: Vertex AI, oft von Google Kubernetes Engine (GKE) angetrieben, verfügt über “Selbstheilung”-Knoten. Wenn ein Hardware-Defekt erkannt wird, migriert die Plattform die Arbeitslast automatisch auf einen gesunden Knoten.
  • Dynamischer Workload-Planer: Dieses Tool ermöglicht es Teams, Kapazitäten basierend auf Dringlichkeit anzufordern. Sie können zwischen Flex Start (günstiger, startet, wenn Kapazitäten verfügbar sind) und garantierten Kapazitäten für mission-kritische Releases wählen.
  • Serverless-Training: Für Teams, die keine Infrastruktur-Verwaltung durchführen möchten, ermöglicht Vertex AI Serverless-Training, Code und Daten zu übermitteln; die Plattform stellt den Cluster bereit, führt den Job aus und beseitigt ihn – und berechnet nur die verwendeten Rechensekunden.

Die drei Einstiegspunkte: Entdeckung, Experimentierung und Automatisierung

Um unterschiedliche technische Persönlichkeiten – von Datenwissenschaftlern bis hin zu Anwendungs-Entwicklern – zu unterstützen, bietet Vertex AI drei primäre Einstiegspunkte:

Model Garden: Der Marktplatz für Entdeckung

Google Cloud’s Vertex AI Model Garden ist eine zentrale Plattform innerhalb von Google Cloud für die Entdeckung, das Testen, die Anpassung und die Bereitstellung einer breiten Palette von ersten, Open-Source- und Drittanbieter-AI-Modellen, einschließlich multimodaler Modelle (Vision, Text, Code) für verschiedene Geschäftsanforderungen, und bietet eine nahtlose Integration mit Vertex AI-Tools für eine gestreamte MLOps.

Model Garden kategorisiert seine 200+ Modelle in drei verschiedene Ebenen, um Architekten die Balance zwischen Leistung, Kosten und Kontrolle zu ermöglichen:

  1. Erste Partei (Google) Modelle: Diese sind die Flaggschiff-Multimodal-Modelle, die innerhalb von Vertex AI verfügbar sind, und Google bietet sie in verschiedenen Größen an, von Pro mit komplexer Argumentation bis hin zu Flash mit geringer Latenz und hoher Volumen, sodass Entwickler ihre Modelle an ihre Anwendungsfälle anpassen können.
  2. Drittanbieter (Proprietary) Modelle: Durch strategische Partnerschaften bietet Vertex AI “Model-as-a-Service” (MaaS)-Zugang zu Titanen wie Anthropic (Claude 3.5) und Mistral AI. Anstatt separate Abrechnungs- und Sicherheits-Anmeldeinformationen für fünf verschiedene AI-Anbieter zu verwalten, kann ein Tech-Team auf all diese über ihr bestehendes Google Cloud-Projekt zugreifen, indem es ein einheitliches API-Format verwendet.
  3. Open-Source- & Open-Weight-Modelle: Diese Ebene umfasst Meta’s Llama 3.2, Mistral und Google’s eigenes Gemma. Diese sind ideal für Organisationen, die Modelle innerhalb ihres eigenen VPC (Virtual Private Cloud) selbst bereitstellen möchten, um maximale Daten-Isolation zu gewährleisten.

In einer nicht einheitlichen Umgebung erfordert die Bereitstellung eines Open-Source-Modells wie Llama die Einrichtung einer PyTorch-Umgebung, die Konfiguration von CUDA-Treibern und die Verwaltung eines Flask- oder FastAPI-Wrappers.

Model Garden eliminiert diese “Munging”-Phase durch vereinheitlichte Managed Endpoints:

  • Ein-Klick-Bereitstellung: Für viele Modelle kann durch Anklicken von “Bereitstellen” automatisch der notwendige TPU/GPU-Ressourcen bereitgestellt, das Modell in einem produktionsreifen Container eingeschlossen und ein REST-API-Endpunkt bereitgestellt werden.
  • Hugging Face-Integration: Vertex AI ermöglicht nun Entwicklern, Modelle direkt aus dem Hugging Face-Hub in ein Vertex-Endpunkt zu deployen, was eine fast unendliche Erweiterung der verfügbaren Intelligenz bietet.
  • Private Service Connect (PSC): Für hoch regulierte Branchen können Modelle mithilfe von Private Service Connect bereitgestellt werden, was sicherstellt, dass der Modell-Endpunkt nie der Öffentlichkeit ausgesetzt ist und den Datenverkehr strikt innerhalb des Unternehmensnetzwerks hält.

Vertex AI Studio: Der Spielplatz für Experimentierung

Während Model Garden um Auswahl geht, ist Vertex AI Studio um Präzision. Vertex AI Studio kann mit den Compilern und Debuggern verglichen werden, die man in der traditionellen Software-Welt findet. Das Vertex AI Studio ist der Arbeitsbereich, in dem rohe Modelle durch eine Kombination aus Prompt-Engineering, multimodalem Testen und erweitertem Hyperparameter-Tuning in spezifische Geschäftstools umgewandelt werden.

Multimodale Prototyping: Jenseits von Text

Eine der herausragenden Funktionen des Studios ist seine native Unterstützung für Multimodalität. Während andere Plattformen komplexe Codierungen für die Verarbeitung von Nicht-Text-Daten erfordern, ermöglicht Vertex AI Studio das direkte Einfügen von Dateien in die Oberfläche, um die Gemini 2.5-Argumentationsfähigkeiten zu testen.

  • Video-Intelligenz: Man kann eine 45-minütige technische Keynote hochladen und das Modell auffordern, “jedes Mal, wenn ein bestimmtes API erwähnt wird, eine timestamp-basierte Zusammenfassung zu liefern”.
  • Dokumentenanalyse: Anstatt nur Text zu lesen, kann das Modell die visuelle Anordnung eines 1.000-seitigen PDF analysieren und die Beziehung zwischen Diagrammen, Tabellen und umgebendem Text verstehen.
  • Code-Ausführung: Studio unterstützt nun die Code-Ausführung im Spielbereich. Wenn man ein Modell auffordert, ein komplexes Mathematik-Problem zu lösen oder eine CSV zu analysieren, kann das Modell Python-Code in einer sicheren, sandbox-basierten Umgebung schreiben und ausführen, um eine verifizierte Antwort zu liefern.

Erweiterte Anpassung: Der Feinabstimmungsweg

Wenn Prompt-Engineering (Zero-Shot oder Few-Shot) an seine Grenzen stößt, bietet Vertex AI Studio die schwere Artillerie: Modell-Feinabstimmung.

  1. Überwachtes Feintuning (SFT): Entwickler stellen ein Dataset von “Prompt/Antwort”-Paaren (idealerweise 100+ Beispiele) bereit. Dies lehrt das Modell, eine bestimmte Markenstimme, Ausgabeformat (wie spezielles JSON) oder domänen-spezifische Jargon zu übernehmen.
  2. Context-Caching: Für Unternehmen, die mit großen, statischen Datenbeständen (wie einer juristischen Bibliothek oder einem Codebasis) zu tun haben, ermöglicht das Studio Context-Caching. Dies ermöglicht es, eine Million Token an Daten im Voraus in das Modell-Gedächtnis zu laden, was die Latenz und Kosten für nachfolgende Anfragen drastisch reduziert.
  3. Destillation (Lehrer-Schüler): Dies ist eine hochrangige architektonische Entscheidung. Man kann ein großes Modell (Gemini 2.5 Pro) verwenden, um ein kleineres, schnelleres Modell (Gemini 2.0 Flash) zu “unterrichten”. Das Ergebnis ist ein leichtes Modell, das auf “Pro”-Niveau performt, aber mit “Flash”-Geschwindigkeit und -Kosten läuft.

Vertex AI Agent Builder: Die Fabrik für Automatisierung

Vertex AI Agent Builder ist ein hochrangiges Orchestrierungs-Framework, das es Entwicklern ermöglicht, diese Agenten durch die Kombination von Grundmodellen mit Unternehmens-Daten und externen APIs zu erstellen.

Die Architektur der “Wahrheit”: Grounding & RAG

Die primäre technische Hürde für Unternehmens-AI ist Halluzination. Agent Builder löst dies durch einen sophisticateden Grounding-Motor.

  • Grounding mit Google Search: Für Anfragen, die Echtzeit-Weltwissen erfordern (z.B. “Was sind die aktuellen Hypotheken-Zinssätze in New York?”), kann der Agent eine Google-Suche durchführen, Fakten extrahieren und Quellen zitieren.
  • Vertex AI Search (RAG-as-a-Service): Anstatt manuell eine Vektor-Datenbank (Pinecone, Weaviate) zu erstellen, können Entwickler Vertex AI Search verwenden, um ihre eigenen Dokumente (PDFs, HTML, BigQuery) zu indexieren. Es handhabt die “Chunking”, “Embedding” und “Abruf”-Schritte automatisch, um sicherzustellen, dass der Agent nur auf Grundlage der internen “Quelle der Wahrheit” antwortet.
  • Vertex AI RAG Engine: Für hochrangige, benutzerdefinierte Implementierungen ermöglicht dieser verwaltete Dienst eine hybride Suche (Kombination von vektor-basierten und keyword-basierten Ergebnissen), um die Genauigkeit um bis zu 30% über Standard-LLM-Ausgaben zu verbessern.

Mehr-Agenten-Orchestrierung (A2A-Protokoll)

Fortgeschrittene Unternehmens-Workflows erfordern oft mehrere spezialisierte Agenten, die zusammenarbeiten. Vertex AI führt das Agent-zu-Agent (A2A)-Protokoll ein, einen offenen Standard, der es ermöglicht:

  • Der “Reise-Agent” kann mit dem “Finanz-Agent” sprechen, um sicherzustellen, dass eine Flugbuchung im Rahmen des Unternehmensbudgets liegt.
  • Interoperabilität: Da es ein offenes Protokoll verwendet, können Agenten, die auf Vertex aufgebaut sind, mit denen kommunizieren, die auf anderen Frameworks wie LangChain oder CrewAI aufgebaut sind.

Die Entwickler-Stack: ADK und Agent Engine

Für die “Tech-Plattform”-Zielgruppe bietet der Agent Builder zwei unterschiedliche Wege:

  1. No-Code-Konsole: Eine visuelle Drag-and-Drop-Schnittstelle für schnelles Prototyping und Geschäftsanpassung.
  2. Agent Development Kit (ADK): Ein code-erstes Python-Toolkit für Ingenieure. Es ermöglicht “Prompt-as-Code”, Version-Kontroll-Integration und die Möglichkeit, auf dem Vertex AI Agent Engine zu deployen – einem verwalteten Laufzeit-System, das Sitzungs-Persistenz, Skalierung und Zustands-Verwaltung automatisch handhabt.

Schlussfolgerung: Von “Was wenn” zu “Was kommt als Nächstes”

Der Übergang von einem beeindruckenden AI-Demo zu einer produktionsreifen Unternehmensanwendung war lange der “Tal des Todes” für digitale Transformationsprojekte. Wie wir gesehen haben, ist Vertex AI speziell darauf ausgelegt, diese Lücke zu schließen. Durch die Vereinigung der fragmentierten Silos von Daten, Infrastruktur und Modell-Orchestrierung hat Google Cloud die Konversation von der rohen Leistung von Large Language Models hin zur betrieblichen Reife des AI-Lebenszyklus verlagert.

Ein Ingenieur von Beruf, ein Schriftsteller von Herzen. Kunal ist ein technischer Schriftsteller mit einer tiefen Liebe und einem tiefen Verständnis für KI und ML, der sich der Aufgabe widmet, komplexe Konzepte in diesen Bereichen durch seine ansprechenden und informativen Dokumentationen zu vereinfachen.