Modèles et plateformes d’IA
Gemini 3.1 Pro atteint des gains de raisonnement record
Google (GOOGL ) a publié Gemini 3.1 Pro le 19 février, une mise à jour de son modèle d’IA phare qui double les performances de raisonnement tout en maintenant les prix identiques à ceux de son prédécesseur.
Le chiffre le plus frappant : sur ARC-AGI-2, un benchmark qui teste la capacité des modèles à résoudre des modèles logiques entièrement nouveaux plutôt que de rappeler les données d’entraînement, Gemini 3.1 Pro obtient un score de 77,1 %. Gemini 3 Pro avait obtenu un score de 31,1 %. Cette augmentation de 46 points de pourcentage constitue le plus grand gain de raisonnement en une seule génération pour une famille de modèles de pointe.
Le modèle est disponible immédiatement sur toutes les plateformes grand public et de développement de Google. Les utilisateurs de l’application Gemini ayant souscrit aux plans AI Pro et AI Ultra ont accès au modèle avec des limites d’utilisation plus élevées, tandis que les développeurs peuvent accéder à 3.1 Pro via l’API Gemini dans AI Studio, Vertex AI, Gemini CLI, Antigravity et Android Studio. NotebookLM bénéficie également de la mise à jour pour les abonnés Pro et Ultra.
Les prix restent les mêmes, à 2 $ par million de jetons d’entrée pour les invites de moins de 200 000 jetons, et à 4 $ pour les contextes plus longs. Le coût de sortie est de 12 $ par million de jetons. Pour les utilisateurs qui utilisent déjà Gemini 3 Pro via l’API, la mise à jour est gratuite.
Performances de référence dans l’ensemble
La fiche du modèle montre que Gemini 3.1 Pro se place en tête sur 12 des 18 benchmarks suivis. Outre ARC-AGI-2, les résultats notables incluent 94,3 % sur GPQA Diamond, un test de raisonnement scientifique de niveau universitaire, et 2 887 Elo sur LiveCodeBench Pro, le score le plus élevé parmi tous les modèles de pointe pour la programmation concurrentielle.
Sur Humanity’s Last Exam, un benchmark tiré de questions d’experts crowdsourcées dans diverses disciplines universitaires, 3.1 Pro atteint 44,4 %, contre 37,5 % pour Gemini 3 Pro et 34,5 % pour GPT-5.2. Le benchmark multilingue MMLU affiche un score de 92,6 %, et la précision à long contexte à 128 000 jetons reste à 84,9 %.
Le modèle conserve une fenêtre de contexte d’entrée de 1 million de jetons et génère jusqu’à 64 000 jetons de sortie, ce qui correspond aux spécifications des outils de génération de code AI qui doivent ingérer des bases de code entières et produire des blocs de code importants en une seule session.
Il est également intéressant de noter où 3.1 Pro ne mène pas. Sur SWE-Bench Verified, un test de tâches d’ingénierie logicielle réelles, il obtient un score de 80,6 %, juste derrière Claude Opus 4.6 d’Anthrropic, qui obtient 80,8 %. L’écart est marginal, mais il montre qu’Anthrropic conserve une légère avance dans les tâches de codage pratiques qui stimulent l’adoption des entreprises.
Qu’est-ce que le raisonnement dynamique change
Gemini 3.1 Pro utilise le raisonnement dynamique par défaut, une approche où le modèle ajuste la quantité de raisonnement interne qu’il applique en fonction de la complexité de chaque invite. Les questions simples obtiennent des réponses rapides. Les problèmes complexes à plusieurs étapes déclenchent des chaînes de traitement plus approfondies avant que le modèle ne génère sa réponse.
Les développeurs peuvent contrôler ce comportement via un paramètre thinking_level dans l’API, en définissant la profondeur maximale du raisonnement interne. Cela répond à une tension dans les modèles de raisonnement : un raisonnement prolongé améliore la précision sur les problèmes difficiles, mais ajoute de la latence et du coût pour les requêtes simples. Le raisonnement dynamique tente d’automatiser cet arbitrage.
Cette fonctionnalité reflète un changement plus large dans l’industrie. Les modèles de la série o d’OpenAI ont introduit le raisonnement en chaîne de pensée comme un mode sélectionnable. Le modèle Claude d’Anthrropic utilise le raisonnement prolongé comme une fonctionnalité facultative. L’approche de Google, qui consiste à le rendre par défaut avec une intensité variable, parie que la plupart des utilisateurs préfèrent laisser le modèle décider à quel point il doit réfléchir plutôt que de gérer cette décision eux-mêmes.
Le champ de la concurrence se resserre
Gemini 3.1 Pro arrive sur un marché où la direction des benchmarks change de mains chaque mois. Le lancement de Gemini 3 par Google a déclenché un “code rouge” chez OpenAI qui a produit GPT-5.2 en moins d’un mois. Anthropic publie des mises à jour de Claude à un rythme accéléré. Chaque sortie réduit l’écart entre les modèles, ce qui rend le choix entre les plateformes de plus en plus dépendant de l’écosystème et du prix plutôt que de la capacité brute.
L’avantage de Google réside dans la distribution. Gemini 3.1 Pro s’intègre directement dans des produits utilisés par des centaines de millions de personnes : Gmail, Docs, Search et les fonctionnalités d’intelligence personnelle qui relient le modèle aux données personnelles des utilisateurs. Le modèle alimente également Gemini Enterprise et Gemini CLI, offrant aux développeurs et aux entreprises un accès via des outils qu’ils utilisent déjà.
Pour les développeurs qui choisissent entre les modèles de pointe, la décision de prix est devenue plus simple. À 2 $ par million de jetons d’entrée, Gemini 3.1 Pro est moins cher que les prix des modèles phares d’OpenAI et d’Anthrropic pour des capacités comparables. La mise à jour gratuite de 3 Pro supprime toute friction de migration pour les utilisateurs existants.
Les gains de raisonnement sont les plus importants pour les applications agentes – les systèmes d’IA qui planifient, exécutent des tâches à plusieurs étapes et utilisent des outils de manière autonome. ARC-AGI-2 teste spécifiquement le type de reconnaissance de modèles novateurs dont les agents ont besoin lorsqu’ils rencontrent des problèmes que leurs données d’entraînement n’ont pas couverts. Un modèle qui obtient un score de 77,1 % sur ce test gère des situations inconnues de manière beaucoup plus fiable qu’un modèle qui obtient un score de 31,1 %.
La question de savoir si ces gains de benchmark se traduisent par des améliorations proportionnelles dans le monde réel est celle que Google devra répondre au cours des semaines à venir. Les benchmarks capturent des capacités spécifiques dans des conditions contrôlées ; l’expérience utilisateur réelle dépend de la façon dont le modèle se comporte sur la gamme imprévisible de tâches que les gens lui confient. Le saut ARC-AGI-2 suggère que 3.1 Pro gère mieux les situations nouvelles que tout modèle précédent. Ce que les utilisateurs feront de cette capacité déterminera si les chiffres ont de l’importance.










