Modèles et plateformes d’IA
Introduction à Vertex AI

Étant donné le paysage en constante évolution de l’intelligence artificielle, l’un des plus grands obstacles que les dirigeants technologiques rencontrent souvent est le passage de l’expérimental à l’entreprise prête. Alors que les chatbots grand public et les plateformes interactives aident l’imagination du public, les entreprises ne peuvent pas réussir avec une simple interface de chat. À une époque où la concurrence est plus agressive que jamais, les entreprises ont besoin d’un écosystème robuste, évolutif et sécurisé, et c’est ce que Google (GOOGL ) tente d’offrir avec Vertex AI, la plateforme d’intelligence artificielle et d’apprentissage automatique unifiée de Google Cloud.
Vertex AI tente de se solidifier comme le fondement de l’intégration de l’IA générative avec les infrastructures cloud modernes, offrant une gamme complète de fonctionnalités qui combler le fossé entre les modèles de base bruts et les applications de production de grade. Vertex AI n’est pas simplement un wrapper pour les grands modèles de langage (LLM), mais plutôt un écosystème d’apprentissage automatique et d’intelligence artificielle (ML/AI) unifié qui traite l’IA générative comme un citoyen de première classe de l’infrastructure cloud moderne.
Au cœur de Vertex AI se trouve le Model Garden, un marché central qui fournit l’accès à plus de 200 modèles de base curatoriaux, y compris le puissant multimodal Gemini 2.5 Pro, qui présente une fenêtre de contexte de 2 millions de jetons. Dans cet article, nous allons analyser l’architecture de Vertex AI, explorer comment Model Garden sert d'”App Store” pour l’intelligence, et examiner les piliers techniques qui font de cette plateforme le fondement du prochain génération de logiciels d’entreprise.
L’Architecture de Base : Une Plateforme Unifiée

Vertex AI n’est pas une collection de outils déconnectés, mais un écosystème de données et d’IA unifié conçu pour combler la fragmentation des données, des outils et des équipes qui affecte l’apprentissage automatique à ce jour. Traditionnellement, le développement de l’IA se déroule dans des environnements isolés, et parfois, les données sont réparties et piégées dans plusieurs référentiels. Par exemple, les organisations peuvent stocker les données client dans des entrepôts SQL tandis que les documents non structurés sont déversés dans un lac de données. Lorsque les données sont cloisonnées, l’IA ne voit que la “vérité partielle”, ce qui conduit à des résultats biaisés ou à des taux d’hallucination élevés car il lui manque le contexte complet de l’entreprise.
Vertex AI tente d’intégrer l’ensemble du cycle de vie, de l’ingestion des données brutes dans BigQuery et Cloud Storage à la surveillance de production, servant essentiellement de “tissu conjonctif” entre ces silos. Vertex AI s’intègre de manière native avec Cloud Storage et BigQuery, permettant aux modèles d’IA de récupérer les données sans pipelines complexes d’extraction, de transformation et de chargement.
Le Fondement : L’Hypercalculateur d’IA de Google
La couche GenAI de Vertex AI repose sur l’architecture d’hypercalculateur d’IA de Google, un système de supercalcul intégré qui se compose de:
TPU v5p & v5e (Unités de Traitement de Tenseurs)
Les unités de traitement de tenseurs de Google sont des circuits intégrés spécifiques à l’application (ASIC) conçus spécifiquement pour la multiplication de matrices qui définit l’apprentissage profond.
- TPU v5p (Performance): Il s’agit de l’accélérateur phare pour la formation à grande échelle. Chaque grappe TPU v5p peut être mise à l’échelle jusqu’à 8 960 puces interconnectées par l’interconnect de chip à chip (ICI) de Google à 4 800 Gbps. Pour un responsable technique, cela signifie une formation 2,8 fois plus rapide pour un modèle de taille GPT-3 (175 milliards de paramètres) par rapport à la génération précédente, réduisant ainsi considérablement le temps de mise sur le marché.
- TPU v5e (Efficiency): Conçu pour une performance “optimisée pour le coût”, le v5e est le cheval de bataille pour la formation à échelle moyenne et l’inférence à haut débit. Il offre jusqu’à 2,5 fois meilleure performance en termes de prix, ce qui en fait le choix idéal pour les entreprises qui doivent exécuter une inférence 24/7 sans budget important.
NVIDIA H100/A100 GPUs pour la Flexibilité
Alors que les TPU sont spécialisés, de nombreux équipes de développement s’appuient sur l’écosystème NVIDIA CUDA. Vertex AI offre un support de première classe pour le matériel le plus récent de NVIDIA:
- NVIDIA H100 (Hopper): Idéal pour l’ajustement fin des plus grands modèles open source (comme Llama 3.1 405B) qui nécessitent une largeur de bande de mémoire massive.
- Jupiter Networking: Pour éviter le “goulet d’étranglement du réseau”, Google utilise son tissu de réseau de centre de données Jupiter. Cela garantit que les données se déplacent entre les GPU à une vitesse fulgurante, en prenant en charge l’accès direct à la mémoire à distance (RDMA) pour contourner la surcharge du processeur et offrir des performances quasi locales sur des nœuds distribués.
Orchestration Dynamique
Le changement technique le plus critique dans Vertex AI est l’Orchestration Dynamique. Dans un environnement hérité, si un nœud GPU échoue pendant une exécution de formation de 3 semaines, l’ensemble du travail peut s’effondrer.
- Résilience Automatique: Vertex AI, souvent alimenté par Google Kubernetes Engine (GKE) sous le capot, présente des nœuds “auto-réparateurs”. Si une défaillance matérielle est détectée, la plateforme migre automatiquement la charge de travail vers un nœud sain.
- Planificateur de Charge de Travail Dynamique: Cet outil permet aux équipes de demander une capacité en fonction de l’urgence. Vous pouvez opter pour Flex Start (moins cher, commence lorsque la capacité est disponible) ou Capacité Garantie pour les versions de mission critique.
- Formation Sans Serveur: Pour les équipes qui souhaitent une gestion d’infrastructure zéro, la formation sans serveur de Vertex AI permet de soumettre votre code et vos données ; la plateforme fournit le cluster, exécute le travail et le détruit—facturant uniquement les secondes de calcul utilisées.
Les Trois Points d’Entrée : Découverte, Expérimentation et Automatisation
Pour accueillir différents personnages techniques, des scientifiques des données aux développeurs d’applications, Vertex AI propose trois points d’entrée principaux:
- Model Garden: Le Marché pour la Découverte.
- Vertex AI Studio: Le Lieu de Jeu pour l’Expérimentation.
- Vertex AI Agent Builder: L’Usine pour l’Automatisation.
Model Garden: Le Marché pour la Découverte
Le Model Garden de Google Cloud est une plateforme centralisée au sein de Google Cloud pour la découverte, le test, la personnalisation et le déploiement d’une large gamme de modèles d’IA de première partie, open source et de tierces parties, y compris les multimodaux (vision, texte, code) pour divers besoins commerciaux, offrant une intégration transparente avec les outils de Vertex AI pour une MLOps rationalisée. Il agit comme une bibliothèque complète, aidant les développeurs et les entreprises à sélectionner le bon modèle (des grands modèles de base aux modèles spécialisés) pour leurs tâches, que ce soit pour la génération de texte, l’analyse d’images ou la complétion de code, et à les déployer efficacement dans leur environnement Google Cloud.

Model Garden catégorise ses 200+ modèles en trois niveaux distincts, permettant aux architectes d’équilibrer les performances, le coût et le contrôle:
- Modèles de Première Partie (Google) : Ce sont les modèles multimodaux phares disponibles dans Vertex AI, et Google les propose dans différentes tailles, allant de Pro avec une raison complexe à Flash avec une faible latence et un volume élevé, permettant ainsi aux développeurs d’optimiser leurs modèles en fonction de leurs cas d’utilisation.
- Modèles de Tierce Partie (Propriétaires) : Grâce à des partenariats stratégiques, Vertex AI propose un accès “Model-as-a-Service” (MaaS) à des géants comme Anthropic (Claude 3.5) et Mistral AI. Au lieu de gérer des informations de facturation et des informations de sécurité distinctes pour cinq fournisseurs d’IA différents, une équipe technique peut accéder à tous ces services via son projet Google Cloud existant, en utilisant un format d’API unifié.
- Modèles Open Source et Open-Weight : Ce niveau inclut Meta’s Llama 3.2, Mistral, et le Gemma de Google. Ceux-ci sont idéaux pour les organisations qui souhaitent déployer des modèles dans leur propre VPC (Réseau Privé Virtuel) pour assurer une isolation des données maximale.
Dans un environnement non unifié, le déploiement d’un modèle open source comme Llama nécessite la configuration d’un environnement PyTorch, la configuration des pilotes CUDA et la gestion d’un wrapper Flask ou FastAPI.
Model Garden élimine cette phase de “mélange” grâce à des Points de Finale Gérés Unifiés:
- Déploiement en Un Clic: Pour de nombreux modèles, cliquer sur “Déployer” provisionne automatiquement les ressources TPU/GPU nécessaires, enveloppe le modèle dans un conteneur prêt pour la production et fournit un point de terminaison d’API REST.
- Intégration Hugging Face: Vertex AI permet désormais aux développeurs de déployer des modèles directement du Hugging Face Hub vers un point de terminaison Vertex, offrant ainsi une expansion presque infinie de l’intelligence disponible.
- Connexion de Service Privé (PSC): Pour les industries hautement réglementées, les modèles peuvent être déployés en utilisant Private Service Connect, en garantissant que le point de terminaison du modèle n’est jamais exposé à Internet public—maintenant le trafic de données strictement dans le réseau d’entreprise.
Vertex AI Studio: Le Lieu de Jeu pour l’Expérimentation
Alors que le Model Garden est axé sur la sélection, Vertex AI Studio est axé sur la précision. Vertex AI Studio peut être comparé aux compilateurs et débogueurs que l’on rencontre dans le monde logiciel traditionnel. Le Vertex AI Studio est l’espace de travail où les modèles bruts sont sculptés en outils d’affaires spécifiques grâce à une combinaison d’ingénierie de prompt, de tests multimodaux et d’ajustement hyperparamétrique avancé.

Prototypage Multimodal: Au-delà du Texte
L’une des fonctionnalités phares du Studio est son support natif pour la multimodalité. Alors que d’autres plateformes nécessitent un codage complexe pour gérer les données non textuelles, Vertex AI Studio vous permet de déposer directement des fichiers dans l’interface pour tester les capacités de raisonnement de Gemini 2.5.
- Intelligence Vidéo: Vous pouvez télécharger une conférence technique de 45 minutes et demander au modèle d'”identifier chaque fois qu’une API spécifique est mentionnée et de fournir un résumé avec horodatage.”
- Analyse de Documents: Au lieu de simplement lire le texte, le modèle peut analyser la disposition visuelle d’un PDF de 1 000 pages, en comprenant les relations entre les graphiques, les tableaux et la prose environnante.
- Exécution de Code: Le Studio prend désormais en charge l’exécution de code dans le lieu de jeu. Si vous demandez à un modèle de résoudre un problème mathématique complexe ou d’analyser un CSV, le modèle peut écrire et exécuter du code Python dans un environnement sécurisé et isolé pour fournir une réponse vérifiée.
Personnalisation Avancée: Le Chemin d’Ajustement

Lorsque l’ingénierie de prompt (Zero-shot ou Few-shot) atteint un plafond, Vertex AI Studio fournit l’outillage lourd: Ajustement de Modèle.
- Ajustement Fin Supervisé (SFT): Les développeurs fournissent un ensemble de données de paires “Prompt/Réponse” (idéalement 100+ exemples). Cela enseigne au modèle à adopter une voix de marque spécifique, un format de sortie (comme un JSON spécialisé), ou un jargon de domaine spécifique.
- Mise en Cache de Contexte: Pour les entreprises qui traitent des ensembles de données massifs et statiques (comme une bibliothèque juridique ou une base de code), le Studio permet la Mise en Cache de Contexte. Cela permet de “précharger” un million de jetons de données dans la mémoire du modèle, réduisant ainsi considérablement la latence et les coûts pour les requêtes ultérieures.
- Distillation (Enseignant-Étudiant): Il s’agit d’une manœuvre architecturale de haut niveau. Vous pouvez utiliser un modèle massif (Gemini 2.5 Pro) pour “enseigner” un modèle plus petit et plus rapide (Gemini 2.0 Flash). Le résultat est un modèle léger qui se comporte au niveau “Pro” mais s’exécute à la vitesse et au coût de “Flash”.
Vertex AI Agent Builder: L’Usine pour l’Automatisation
Vertex AI Agent Builder est un cadre d’orchestration de haut niveau qui permet aux développeurs de créer ces agents en combinant des modèles de base avec des données d’entreprise et des API externes.
L’Architecture de la “Vérité”: Ancrage et RAG
La principale barrière technique à l’IA d’entreprise est l’hallucination. Agent Builder résout cela grâce à un moteur d’Ancrage sophistiqué.
- Ancrage avec Google Search: Pour les requêtes nécessitant des connaissances mondiales en temps réel (par exemple, “Quels sont les taux d’hypothèque actuels à New York ?”), l’agent peut effectuer une recherche Google, extraire les faits et citer ses sources.
- Recherche Vertex AI (RAG-en-tant-que-Service): Au lieu de construire manuellement une base de données vectorielle (Pinecone, Weaviate), les développeurs peuvent utiliser Recherche Vertex AI pour indexer leurs propres documents (PDF, HTML, BigQuery). Il gère automatiquement les étapes de “décomposition”, “intégration” et “récupération”, garantissant que l’agent ne répond qu’en fonction de votre “Source de Vérité” interne.
- Moteur RAG Vertex AI: Pour les implémentations personnalisées à grande échelle, ce service géré permet une recherche hybride (combinant des résultats basés sur des vecteurs et des mots clés) pour améliorer la précision de jusqu’à 30% par rapport aux sorties LLM standard.
Orchestration Multi-Agents (Protocole A2A)
Les flux de travail d’entreprise avancés nécessitent souvent plusieurs agents spécialisés travaillant ensemble. Vertex AI introduit le Protocole Agent-à-Agent (A2A), un standard ouvert qui permet:
- L'”Agent de Voyage” peut discuter avec l’“Agent Financier” pour s’assurer qu’une réservation de vol est dans le budget de l’entreprise.
- Interopérabilité: Puisqu’il utilise un protocole ouvert, les agents construits sur Vertex peuvent communiquer avec ceux construits sur d’autres cadres comme LangChain ou CrewAI.
La Pile de Développement: ADK et Moteur d’Agent
Pour le public de la “plateforme technique”, l’Agent Builder offre deux chemins distincts:
- Console Sans Code: Une interface graphique de glisser-déposer pour la prototypage rapide et la configuration de l’utilisateur commercial.
- Kit de Développement d’Agent (ADK): Un kit de développement Python pour les ingénieurs. Il permet le “Prompt-en-tant-que-Code”, l’intégration du contrôle de version et la possibilité de déployer sur le Moteur d’Agent Vertex AI—un environnement d’exécution géré qui gère automatiquement la persistance de session, le scaling et la gestion d’état.
Conclusion: De “Et si” à “Qu’est-ce qui suit”
La transition d’une démonstration d’IA spectaculaire à une application d’entreprise de production a longtemps été le “val d’abîme” pour les projets de transformation numérique. Comme nous l’avons exploré, Vertex AI est conçu spécifiquement pour combler ce fossé. En unifiant les silos fragmentés de données, d’infrastructure et d’orchestration de modèles, Google Cloud a déplacé la conversation loin de la puissance brute des grands modèles de langage et vers la maturité opérationnelle du cycle de vie de l’IA.












