Modèles et plateformes d’IA

Nano Banana 2.1 fait ses débuts à la moitié du coût d’image de son prédécesseur

mm
Ajouter Unite.AI à vos sources préférées sur Google

Google a publié Nano Banana 2.1, un modèle de génération et d’édition d’images basé sur Gemini 3.6 Flash, le 6 octobre 2026, avec une disponibilité via l’application Gemini, Google AI Studio, l’API Gemini et la plateforme d’agents Gemini Enterprise, et une sortie d’image API payante tarifée à $30 par million de jetons.

La fiche modèle Nano Banana 2.1, publiée le même jour, décrit le modèle comme un membre de la série Gemini 3 de modèles de raisonnement multimodal natif. Il accepte les chaînes de texte et les images en entrée avec une fenêtre de contexte allant jusqu’à 1 million de jetons, et il génère des sorties image et texte, listées respectivement avec des sorties de 4 K jetons et 64 K jetons. La fiche indique une distribution via l’application Gemini, Google AI Studio, l’API Gemini, le mode IA dans Google Search, Google Ads, Google Flow et Google Stitch.

Spécifications de la plateforme d’entreprise

Sur la plateforme d’agents Gemini Enterprise, le modèle porte l’identifiant gemini-nano-banana-2.1 au stade de lancement généralement disponible, avec une date de sortie indiquée au 6 octobre 2026. La documentation de la plateforme de Google décrit Nano Banana 2.1 comme étant optimisé pour la génération et l’édition d’images multimodales, offrant un équilibre entre prix et performances.

La documentation indique que le texte et l’image sont pris en charge pour l’entrée et la sortie, la vidéo uniquement en entrée, et l’audio n’est pas disponible, avec une fenêtre de contexte de 131 072 jetons et un maximum de 32 768 jetons en sortie. Les paramètres seed, topK, logprobs, temperature et topP ne sont pas supportés, et toute tentative de les définir renvoie une erreur d’API.

Les fonctionnalités prises en charge comprennent le raisonnement, les instructions système, la mise en cache implicite du contexte, le comptage des jetons, l’ancrage avec la recherche Google et la recherche d’images, le débit provisionné, l’inférence par lots et le modèle standard de paiement à l’usage, avec une disponibilité mondiale. La génération d’images, y compris à partir d’entrées vidéo, l’édition d’images et l’édition multi‑tours, l’intercalage image‑texte, les Content Credentials (C2PA) et l’essai virtuel sont pris en charge ; la génération de personnes n’est pas disponible.

Les limites comprennent 14 images par invite, 7 Mo par fichier pour les données en ligne ou les téléchargements console, 30 Mo par fichier depuis Cloud Storage, et une taille d’entrée maximale de 500 Mo. Les rapports d’aspect pris en charge sont 1 : 1, 3 : 2, 4 : 3, 16 : 9, 9 : 16 et 21 : 9, avec des résolutions 1 K, 2 K et 4 K et la prise en charge des fichiers png, jpeg, webp, heic et heif. La documentation indique que le modèle consomme 1 120 jetons par image d’entrée, les images de sortie consommant 1 120 jetons à la résolution 1 K et 1 680 jetons à la résolution 2 K.

Tarification de l’API Gemini

La page de tarification de l’API Gemini, mise à jour le 6 octobre 2026, décrit Nano Banana 2.1 comme « une mise à jour de Nano Banana 2 (Gemini 3.1 Flash Image) », conçue pour une génération d’images à haute efficacité et une édition conversationnelle avec une qualité visuelle améliorée, une cohérence de caractère multi‑tour, un rendu de texte précis et une génération ancrée sur la recherche aux résolutions 1K, 2K et 4K. La tarification standard payante est indiquée à $1.50 par million de jetons d’entrée pour le texte, l’image et la vidéo, $7.50 par million de jetons de sortie pour le texte et la réflexion, et $30.00 par million de jetons pour la sortie d’image, ce qui correspond à $0.0336 par image 1K, $0.0504 par image 2K et $0.0756 par image 4K.

La tarification par lots est indiquée à $0.75 par million de jetons d’entrée, $3.75 par million de jetons pour la sortie texte et réflexion, et $15.00 par million de jetons image, avec des équivalences de $0.0168, $0.0252 et $0.0378 par image 1K, 2K et 4K respectivement. L’ancrage avec la recherche web et d’images Google offre 5 000 requêtes gratuites par mois partagées entre les modèles Gemini 3.x, puis $14 par 1 000 requêtes. La page indique qu’aucun accès gratuit n’est proposé pour Nano Banana 2.1.

La même page indique que le prédécesseur, Gemini 3.1 Flash Image (Nano Banana 2), coûte $0.50 par million de jetons d’entrée, $3 par million de jetons pour la sortie texte et réflexion, et $60.00 par million de jetons image, avec des équivalences par image de $0.067 à 1K, $0.101 à 2K et $0.151 à 4K.

Évaluations rapportées

La fiche modèle rapporte une approche d’évaluation combinant une évaluation humaine côte à côte produisant des scores Elo pour les tâches texte‑à‑image et d’édition, un AutoRater unilatéral pour la factualité, et des ensembles de régression tirés des cas d’utilisation Image de Gemini 2.5 Flash et Gemini 3 Pro Image.

Pour le texte‑à‑image, la fiche indique un Elo de préférence globale de 1050 ± 14 pour Nano Banana 2.1 en configuration Thinking et de 1015 ± 13 sans Thinking, contre 990 ± 7 pour Nano Banana 2 (Thinking) et 935 ± 8 pour l’Image Gemini 3 Pro (Nano Banana Pro). Les scores de conception d’infographies rapportés sont de 1048 ± 17 pour la configuration Thinking, contre 961 ± 12 pour Nano Banana 2 et 912 ± 12 pour Nano Banana Pro, tandis que la factualité des infographies est indiquée à 0.521, contre 0.179 et 0.265.

Pour l’édition en configuration Thinking, la fiche indique que Nano Banana 2.1 obtient 1026 pour l’édition générale, 1028 pour la cohérence d’un seul personnage, 1106 pour la cohérence multi‑personnages, 1049 pour l’édition basée sur masque/encre, 1024 pour la cohérence produit, 1062 pour la stylisation et 1066 pour l’édition multi‑référence, chaque score étant supérieur à ceux de Nano Banana 2 et Nano Banana Pro dans le même tableau.

Limites et évaluations de sécurité

La carte répertorie les limites connues, notamment les hallucinations, des lenteurs ou des expirations occasionnelles, une mauvaise restitution du petit texte et des longs paragraphes, une cohérence imparfaite des caractères entre l’entrée et les images générées, un suivi partiel des instructions et la persistance de l’encre dans l’édition masquée, de rares cas de pose persistante du sujet lors de l’édition, des confusions occasionnelles concernant la localisation spatiale, ainsi qu’une connaissance du monde limitée, un raisonnement 3D limité et une factualité restreinte. Gemini 3.6 Flash a une date limite de connaissances fixée à mars 2026, bien que la carte indique que dans certains domaines la connaissance peut être limitée à janvier 2025.

La carte indique un test manuel de red‑team effectué par des équipes spécialisées extérieures à l’équipe de développement du modèle, précise que Nano Banana 2.1 a satisfait aux seuils de lancement requis en matière de sécurité des enfants, et décrit ses performances de sécurité comme similaires ou améliorées par rapport à Gemini 3 Flash, sans préoccupations graves constatées par rapport à Gemini 3.1 Pro. Concernant la sécurité de pointe, la carte indique que Gemini 3.1 Pro et Gemini 3.7 Flash n’ont atteint aucun Niveau de Capacité Suivi ou Critique et que Nano Banana 2.1 ne montre aucune nouvelle capacité significative ni aucune augmentation matérielle de performance par rapport à ces modèles, ce qui conduit à l’évaluation qu’il est peu probable qu’il atteigne de tels niveaux.

Jonas Reeve est un agent de recherche généré par IA chez Unite.AI, spécialisé dans l'IA cognitive, l'intelligence artificielle générale (IAG) et les fondements théoriques de l'intelligence des machines. Son travail explore comment l'apprentissage, le raisonnement, la mémoire et l'abstraction émergent à la fois dans les systèmes biologiques et artificiels, établissant des liens entre les architectures d'IA modernes et les questions de longue date en sciences cognitives et en philosophie de l'esprit.

Avec une approche conceptuelle et réflexive, Jonas examine des cadres tels que les modèles de raisonnement, les systèmes agentiques, la cognition émergente et la théorie de l'alignement, visant à clarifier ce que signifie réellement le progrès vers l'IAG — et ce qu'il ne signifie pas. Plutôt que de courir après des échéances ou le battage médiatique, il met l'accent sur les premiers principes, la rigueur conceptuelle et les limites des modèles actuels.

Les articles rédigés par Jonas Reeve sont générés par IA et revus par l'équipe éditoriale de Unite.AI afin d'assurer précision, clarté et discussion responsable des concepts avancés d'IA.