IAG et IA du futur

Explorer Gemini 1.5 : Comment le dernier modèle d’IA multimodale de Google élève le paysage de l’IA au-delà de son prédécesseur

mm
Ajouter Unite.AI à vos sources préférées sur Google

Dans le paysage en constante évolution de l’intelligence artificielle, Google (GOOGL ) continue de mener avec ses développements pionniers dans les technologies d’IA multimodale. Peu après la sortie de Gemini 1.0, son modèle de langage multimodal de pointe, Google a maintenant dévoilé Gemini 1.5. Cette itération non seulement améliore la capacité établie par Gemini 1.0, mais apporte également des améliorations significatives dans la méthode de Google pour traiter et intégrer des données multimodales. Cet article propose une exploration de Gemini 1.5, mettant en lumière son approche innovante et ses fonctionnalités distinctives.

Gemini 1.0 : Poser les fondations

Lancé par Google DeepMind et Google Research le 6 décembre 2023, Gemini 1.0 a introduit une nouvelle génération de modèles d’IA multimodaux capables de comprendre et de générer du contenu dans divers formats, tels que du texte, de l’audio, des images et des vidéos. Cela a marqué une étape importante dans l’IA, élargissant la portée pour gérer différents types d’informations.

La fonctionnalité phare de Gemini est sa capacité à combiner sans effort plusieurs types de données. Contrairement aux modèles d’IA conventionnels qui peuvent se spécialiser dans un seul format de données, Gemini intègre du texte, des visuels et de l’audio. Cette intégration lui permet de réaliser des tâches telles que l’analyse de notes manuscrites ou la décodification de diagrammes complexes, résolvant ainsi un large éventail de défis complexes.

La famille Gemini propose des modèles pour diverses applications : le modèle Ultra pour les tâches complexes, le modèle Pro pour la vitesse et la scalabilité sur des plates-formes majeures comme Google Bard, et les modèles Nano (Nano-1 et Nano-2) avec 1,8 milliard et 3,25 milliards de paramètres, respectivement, conçus pour une intégration dans des appareils tels que le smartphone Google Pixel 8 Pro.

Le saut vers Gemini 1.5

La dernière version de Google, Gemini 1.5, améliore la fonctionnalité et l’efficacité opérationnelle de son prédécesseur, Gemini 1.0. Cette version adopte une nouvelle architecture Mixture-of-Experts (MoE), une déviation de l’approche de modèle large unifié vue dans son prédécesseur. Cette architecture intègre une collection de modèles de transformateurs plus petits et spécialisés, chacun habile à gérer des segments de données spécifiques ou des tâches distinctes. Cette configuration permet à Gemini 1.5 de dynamiquement engager l’expert le plus approprié en fonction des données entrantes, rationalisant la capacité du modèle à apprendre et à traiter l’information.

Cette approche innovante élève considérablement l’efficacité de formation et de déploiement du modèle en activant uniquement les experts nécessaires pour les tâches. Par conséquent, Gemini 1.5 est capable de maîtriser rapidement des tâches complexes et de fournir des résultats de haute qualité de manière plus efficace que les modèles conventionnels. De telles avancées permettent aux équipes de recherche de Google d’accélérer le développement et l’amélioration du modèle Gemini, étendant les possibilités dans le domaine de l’IA.

Élargir les capacités

Une avancée notable dans Gemini 1.5 est sa capacité de traitement d’informations élargie. La fenêtre de contexte du modèle, qui est la quantité de données utilisateur qu’il peut analyser pour générer des réponses, s’étend maintenant à jusqu’à 1 million de jetons — une augmentation considérable par rapport aux 32 000 jetons de Gemini 1.0. Cette amélioration signifie que Gemini 1.5 Pro peut traiter simultanément de grandes quantités de données, telles qu’une heure de contenu vidéo, onze heures d’audio ou de grandes bases de code et documents textuels. Il a également été testé avec succès avec jusqu’à 10 millions de jetons, mettant en évidence sa capacité exceptionnelle à comprendre et à interpréter d’énormes ensembles de données.

Un aperçu des capacités de Gemini 1.5

Les améliorations architecturales de Gemini 1.5 et la fenêtre de contexte élargie le rendent capable de réaliser des analyses sophistiquées sur de grands ensembles d’informations. Que ce soit pour se plonger dans les détails intriqués de la mission Apollo 11 transcripts ou pour interpréter un film muet, Gemini 1.5 démontre des capacités de résolution de problèmes inégalées, en particulier avec de longs blocs de code.

Développé sur les accélérateurs TPUv4 avancés de Google, Gemini 1.5 Pro a été formé sur un ensemble de données diversifié, englobant divers domaines et incluant du contenu multimodal et multilingue. Cette large base de formation, combinée à un affinage basé sur des données de préférence humaine, garantit que les sorties de Gemini 1.5 Pro correspondent bien aux perceptions humaines.

Grâce à des tests de référence rigoureux contre une multitude de tâches, Gemini 1.5 Pro ne dépasse pas seulement son prédécesseur dans la majorité des évaluations, mais se tient également au niveau du plus grand modèle Ultra de Gemini 1.0. Gemini 1.5 Pro montre de fortes capacités d’apprentissage « en contexte », acquérant efficacement de nouvelles connaissances à partir de prompts détaillés sans nécessiter d’ajustements supplémentaires. Cela a été particulièrement évident dans sa performance sur le Machine Translation from One Book (MTOB) benchmark, où il a traduit de l’anglais en Kalamang — une langue parlée par un petit nombre de personnes — avec une compétence comparable à celle de l’apprentissage humain, soulignant ainsi son adaptabilité et son efficacité d’apprentissage.

Accès à l’aperçu limité

Gemini 1.5 Pro est maintenant disponible dans une version d’aperçu limitée pour les développeurs et les clients d’entreprise via AI Studio et Vertex AI, avec des plans pour une sortie plus large et des options personnalisables à l’horizon. Cette phase d’aperçu offre une opportunité unique d’explorer sa fenêtre de contexte élargie, avec des améliorations de la vitesse de traitement anticipées. Les développeurs et les clients d’entreprise intéressés par Gemini 1.5 Pro peuvent s’inscrire via AI Studio ou contacter leurs équipes de compte Vertex AI pour obtenir plus d’informations.

En résumé

Gemini 1.5 représente une étape notable vers l’avant dans le développement de l’IA multimodale. En s’appuyant sur les fondations posées par Gemini 1.0, cette nouvelle version apporte des méthodes améliorées pour traiter et intégrer différents types de données. L’introduction d’une approche architecturale novatrice et de capacités de traitement de données élargies met en évidence les efforts constants de Google pour améliorer la technologie de l’IA. Avec son potentiel pour une gestion de tâches plus efficace et un apprentissage avancé, Gemini 1.5 montre l’évolution continue de l’IA. Actuellement disponible pour un groupe sélectionné de développeurs et de clients d’entreprise, il signale des possibilités excitantes pour l’avenir de l’IA, avec une disponibilité plus large et des avancées supplémentaires à l’horizon.

Dr. Tehseen Zia est un professeur associé titulaire à l'Université COMSATS d'Islamabad, titulaire d'un doctorat en intelligence artificielle de l'Université technique de Vienne, en Autriche. Spécialisé en intelligence artificielle, apprentissage automatique, science des données et vision par ordinateur, il a apporté des contributions significatives avec des publications dans des revues scientifiques réputées. Dr. Tehseen a également dirigé divers projets industriels en tant que chercheur principal et a servi en tant que consultant en intelligence artificielle.