Prompt engineering

Un regard plus approfondi sur DALL-E 3 d’OpenAI

mm
Ajouter Unite.AI à vos sources préférées sur Google
DALL·E 3

Dans le monde de l’intelligence artificielle générative, rester à jour est essentiel. Et lorsqu’il s’agit de générer des images, Stable Diffusion et Midjourney étaient les plates-formes dont tout le monde parlait – jusqu’à maintenant.

OpenAI, soutenue par le géant de la technologie Microsoft (MSFT ), a présenté DALL·E 3 le 20 septembre 2023.

DALL-E 3 ne consiste pas seulement à créer des images ; il s’agit de donner vie à vos idées, exactement comme vous les avez imaginées. Et le meilleur ? C’est rapide, vraiment rapide. Vous avez une idée, vous la donnez à DALL-E 3, et voilà, votre image est prête.

Donc, dans cet article, nous allons plonger dans ce qu’est DALL-E 3. Nous allons parler de son fonctionnement, de ce qui le distingue des autres et de pourquoi il pourrait être l’outil dont vous n’aviez pas conscience qu’il vous manquait. Que vous soyez designer, artiste ou simplement quelqu’un avec beaucoup d’idées sympas, vous allez vouloir rester pour cela. Commençons.

Ce qui est nouveau avec DALL·E 3, c’est qu’il comprend mieux le contexte que DALL·E 2. Les versions précédentes pouvaient manquer certains détails ou ignorer certains détails ici et là, mais DALL·E 3 est précis. Il capte les détails exacts de ce que vous demandez, vous donnant une image qui est plus proche de ce que vous aviez imaginé.

La partie cool ? DALL·E 3 et ChatGPT sont maintenant intégrés ensemble. Ils travaillent ensemble pour aider à affiner vos idées. Vous tirez une idée, ChatGPT aide à affiner la invite, et DALL·E 3 la met en vie. Si vous n’aimez pas l’image, vous pouvez demander à ChatGPT de modifier l’invite et faire essayer à nouveau à DALL·E 3. Pour un coût mensuel de 20 $, vous avez accès à GPT-4, DALL·E 3 et de nombreuses autres fonctionnalités sympas.

Le Bing Chat de Microsoft a obtenu DALL·E 3 même avant que le ChatGPT d’OpenAI ne l’obtienne, et maintenant ce n’est pas seulement les grandes entreprises qui peuvent jouer avec, mais tout le monde peut jouer avec gratuitement. L’intégration dans Bing Chat et Bing Image Creator le rend beaucoup plus facile à utiliser pour tout le monde.

L’essor des modèles de diffusion

Au cours des trois dernières années, l’intelligence artificielle visuelle a connu l’essor des modèles de diffusion, réalisant un bond en avant important, en particulier dans la génération d’images. Avant les modèles de diffusion, les réseaux antagonistes génératifs (GAN) étaient la technologie de choix pour générer des images réalistes.

GANs

GANs

Cependant, ils avaient leurs propres défis, notamment la nécessité de grandes quantités de données et de puissance de calcul, ce qui les rendait souvent difficiles à gérer.

Entrent les modèles de diffusion. Ils sont apparus comme une alternative plus stable et plus efficace aux GAN. Contrairement aux GAN, les modèles de diffusion fonctionnent en ajoutant du bruit aux données, les obscurcissant jusqu’à ce que seul le hasard reste. Ils travaillent ensuite à l’envers pour inverser ce processus, reconstruisant des données significatives à partir du bruit. Ce processus s’est avéré efficace et moins gourmand en ressources, ce qui fait des modèles de diffusion un sujet brûlant dans la communauté de l’IA.

Le véritable tournant est arrivé vers 2020, avec une série de documents innovants et l’introduction de la technologie CLIP d’OpenAI, qui a considérablement amélioré les capacités des modèles de diffusion. Cela a rendu les modèles de diffusion exceptionnellement bons dans la synthèse d’images texte, leur permettant de générer des images réalistes à partir de descriptions textuelles. Ces avancées n’étaient pas seulement dans la génération d’images, mais également dans des domaines tels que la composition musicale et la recherche biomédicale.

Aujourd’hui, les modèles de diffusion ne sont pas seulement un sujet d’intérêt académique, mais sont utilisés dans des scénarios réels et pratiques.

Modélisation générative et couches d’auto-attention : DALL-E 3

L’une des avancées critiques dans ce domaine a été l’évolution de la modélisation générative, avec des approches basées sur l’échantillonnage comme la modélisation générative autoregressive et les processus de diffusion menant la way. Ils ont transformé les modèles d’image texte, conduisant à des améliorations de performances drastiques. En décomposant la génération d’images en étapes distinctes, ces modèles sont devenus plus faciles à apprendre pour les réseaux de neurones.

En parallèle, l’utilisation de couches d’auto-attention a joué un rôle crucial. Ces couches, empilées les unes sur les autres, ont aidé à générer des images sans les biais spatiaux implicites, un problème courant avec les convolutions. Ce changement a permis aux modèles d’image texte de s’étendre et de s’améliorer de manière fiable, grâce aux propriétés de mise à l’échelle bien comprises des transformateurs.

Défis et solutions dans la génération d’images

Malgré ces progrès, le contrôle dans la génération d’images reste un défi. Des problèmes tels que le suivi des invites, où le modèle peut ne pas adhérer étroitement au texte d’entrée, ont été courants. Pour résoudre cela, de nouvelles approches telles que l’amélioration des légendes ont été proposées, visant à améliorer la qualité des paires texte et image dans les jeux de données d’entraînement.

Amélioration des légendes : une approche novatrice

L’amélioration des légendes consiste à générer des légendes de meilleure qualité pour les images, ce qui à son tour aide à entraîner des modèles d’image texte plus précis. Cela est réalisé grâce à un robuste système de légendage d’images qui produit des descriptions détaillées et précises des images. En s’entraînant sur ces légendes améliorées, DALL-E 3 a pu obtenir des résultats remarquables, ressemblant étroitement à des photographies et à des œuvres d’art produites par des humains.

Entraînement sur des données synthétiques

Le concept d’entraînement sur des données synthétiques n’est pas nouveau. Cependant, la contribution unique ici réside dans la création d’un système novateur de légendage d’images descriptif. L’impact de l’utilisation de légendes synthétiques pour l’entraînement de modèles génératifs a été considérable, conduisant à des améliorations de la capacité du modèle à suivre les invites avec précision.

Évaluation de DALL-E 3

Grâce à de multiples évaluations et comparaisons avec des modèles précédents comme DALL-E 2 et Stable Diffusion XL, DALL-E 3 a démontré des performances supérieures, en particulier dans les tâches liées au suivi des invites.

Comparison of text-to-image models on various evaluations

Comparison of text-to-image models on various evaluations

L’utilisation d’évaluations automatisées et de références a fourni des preuves claires de ses capacités, consolidant sa position en tant que générateur d’images texte de pointe.

Invites et capacités de DALL-E 3

DALL-E 3 offre une approche plus logique et raffinée de la création de visuels. Au fur et à mesure que vous faites défiler, vous remarquerez comment DALL-E crée chaque image, avec un mélange de précision et d’imagination qui résonne avec l’invite donnée.

Contrairement à son prédécesseur, cette version améliorée excelle dans l’agencement d’objets de manière naturelle dans une scène et dans la représentation de caractéristiques humaines avec précision, jusqu’au nombre correct de doigts sur une main. Les améliorations s’étendent à des détails plus fins et sont maintenant disponibles à une résolution plus élevée, garantissant une sortie plus réaliste et professionnelle.

Les capacités de rendu de texte ont également connu une amélioration considérable. Là où les versions précédentes de DALL-E produisaient du texte sans sens, DALL-E 3 peut maintenant générer du texte lisible et professionnellement stylisé (parfois), et même des logos propres à l’occasion.

La compréhension du modèle de demandes d’images complexes et nuancées a été considérablement améliorée. DALL-E 3 peut maintenant suivre avec précision des descriptions détaillées, même dans des scénarios avec plusieurs éléments et instructions spécifiques, démontrant sa capacité à produire des images cohérentes et bien composées. Explorons quelques invites et les sorties que nous avons obtenues :

Concevez l'emballage d'une ligne de thés biologiques. Incluez un espace pour le nom du produit et la description.

DALL-E 3 images based on text prompts

DALL-E 3 images based on text prompts (Note that the left poster have wrong spelling)

Créez une bannière Web pour une vente d'été de meubles de jardin. L'image présente un décor de plage avec différents meubles de jardin et du texte annonçant 'Huge Summer Savings!'

DALL-E 3 images based on text prompts

DALL-E 3 images based on text prompts

Un affiche de voyage vintage de Paris avec du texte stylisé disant 'Visit Paris' en bas.

DALL-E 3 images based on text prompts

DALL-E 3 images based on text prompts (Note that both posters have wrong spellings)

Générez une image de la fête de Diwali en Inde, avec des familles allumant des lampes, des feux d'artifice dans le ciel et des sucreries et décorations traditionnelles.
DALL-E 3 images based on text prompts

DALL-E 3 images based on text prompts

Générez une image d'un marché en plein essor dans la Rome antique, avec des gens en vêtements de l'époque, divers produits à vendre et l'architecture de l'époque.
DALL-E 3 images based on text prompts

DALL-E 3 images based on text prompts

Générez une image d'une figure historique célèbre, comme Cléopâtre ou Léonard de Vinci, placée dans un contexte contemporain, en utilisant la technologie moderne telle que les smartphones ou les ordinateurs portables.
DALL-E 3 images based on text prompts

DALL-E 3 images based on text prompts

Limitations et risques de DALL-E 3

OpenAI a pris des mesures importantes pour filtrer le contenu explicite des données d’entraînement de DALL-E 3, visant à réduire les biais et améliorer la sortie du modèle. Cela inclut l’application de filtres spécifiques pour les catégories de contenu sensibles et une révision des seuils pour les filtres plus larges. La pile de mitigation comprend également plusieurs couches de garanties, telles que des mécanismes de refus dans ChatGPT pour les sujets sensibles, des classificateurs d’invite pour prévenir les violations de politique, des listes de blocage pour des catégories de contenu spécifiques et des transformations pour garantir que les invites sont conformes aux directives.

Malgré ses avancées, DALL-E 3 a des limitations dans la compréhension des relations spatiales, le rendu de long texte avec précision et la génération d’images spécifiques. OpenAI reconnaît ces défis et travaille sur des améliorations pour les versions futures.

L’entreprise travaille également sur des moyens de différencier les images générées par l’IA de celles créées par des humains, reflétant leur engagement en faveur de la transparence et de l’utilisation responsable de l’IA.

DALL·E

DALL·E 3

DALL-E 3, la dernière version, sera disponible par phases, en commençant par des groupes de clients spécifiques et en s’étendant plus tard aux laboratoires de recherche et aux services d’API. Cependant, une date de sortie publique gratuite n’est pas encore confirmée.

OpenAI est vraiment en train de fixer de nouvelles normes dans le domaine de l’IA avec DALL-E 3, en reliant sans effort des capacités techniques complexes et des interfaces utilisateur conviviales. L’intégration de DALL-E 3 dans des plates-formes largement utilisées comme Bing reflète un passage d’applications spécialisées à des formes plus larges et plus accessibles de divertissement et d’utilité.

Le véritable jeu-changer dans les années à venir sera probablement l’équilibre entre l’innovation et l’autonomisation de l’utilisateur. Les entreprises qui prospèreront seront celles qui non seulement repousseront les limites de ce que l’IA peut accomplir, mais également offriront aux utilisateurs l’autonomie et le contrôle qu’ils souhaitent. OpenAI, avec son engagement en faveur d’une IA éthique, navigue prudemment sur ce chemin. L’objectif est clair : créer des outils d’IA qui ne sont pas seulement puissants, mais également dignes de confiance et inclusifs, garantissant que les avantages de l’IA soient accessibles à tous.

J'ai passé les cinq dernières années à plonger dans le monde fascinant de l'apprentissage automatique et du deep learning. Ma passion et mon expertise m'ont conduit à contribuer à plus de 50 projets de génie logiciel divers, avec un focus particulier sur l'IA/ML. Ma curiosité continue m'a également attiré vers le traitement automatique des langues, un domaine que je suis impatient d'explorer plus en profondeur.