Prompt engineering

Maîtriser l’art de l’IA : Un guide concis pour Midjourney et l’ingénierie de prompts

mm
Ajouter Unite.AI à vos sources préférées sur Google
Midjourney Generated UNITE AI LOGO

Introduction à l’art généré par MidJourney AI

L’IA brise rapidement les barrières de l’impossible et a récemment envahi le domaine de l’art, le transformant entièrement. Vous n’avez plus besoin d’être un artiste maître ou un expert en Photoshop pour donner vie aux créations de votre imagination. Un simple prompt bien articulé suffit, grâce à Midjourney.

Tout a commencé avec l’introduction de technologies révolutionnaires comme DALL-E, Midjourney et StableDiffusion en 2022. Chacune de ces innovations a apporté sa touche distinctive au domaine de l’IA générative, et Midjourney, en particulier, a continué son parcours convaincant, réalisant des progrès notables.

Midjourney est actuellement le principal générateur d’images haute résolution texte-à-image sur le marché et se distingue par son mélange unique de génération d’images texte-à-image, d’édition de médias et de mise à l’échelle, ainsi que d’accès à une communauté d’art active, le tout à partir de 10 $ par mois. Cette gamme complète de fonctionnalités présente un canevas excitant pour les artistes, les enthousiastes de la technologie et les professionnels de l’IA, créant un environnement propice à la créativité et à l’innovation.

Le monde de l’art prend certainement note, avec une croissance projetée de 40,5 % pour l’IA générative sur le marché de l’art. Midjourney est inégalé dans la création de visuels réalistes et de haute qualité à l’aide de l’IA.

L’ingénierie de prompts efficace va au-delà de la simple création ; elle englobe les meilleures pratiques. Les prompts doivent offrir de la clarté, être concis, mais fournir à l’IA suffisamment de directives sans prescription excessive. De plus, le public cible doit être pris en compte lors de la conception, en tenant compte de variables telles que l’âge, le sexe et le contexte culturel, entre autres.

Comment fonctionne MidJourney ?

Mid-Journey utilise deux technologies d’apprentissage automatique novatrices : les modèles de langage et les modèles de diffusion. Le modèle de langage, similaire aux chatbots IA comme ChatGPT, aide Mid-Journey à interpréter le sens de vos prompts et à les convertir en vecteurs. Ce vecteur guide ensuite le processus de diffusion.

Les mécanismes internes de Midjourney sont largement non divulgués. Cependant, il est évident qu’il utilise la génération d’images texte-à-image à partir de deux technologies d’apprentissage automatique relativement nouvelles : les modèles de langage et les modèles de diffusion. Le premier est peut-être familier aux utilisateurs de plateformes IA comme ChatGPT, et le second est un ajout prometteur au secteur de la génération d’art IA. L’ensemble du système repose sur le jeu de données CLIP pour la formation, que l’on peut trouver sur la page de recherche d’OpenAI.

Malgré les informations limitées, il est possible d’esquisser un large tableau du modèle de diffusion de Midjourney, appelé ‘Stable Diffusion’. Essentiellement, Stable Diffusion est un modèle open-source qui transforme habilement les prompts texte en images de styles et de contenus variés. Cette procédure sophistiquée est réalisée à l’aide d’un modèle de diffusion, un modèle génératif qui relie les dépendances entre les entrées texte et les sorties image.

Les modèles de diffusion sont construits sur la base de la méthode de diffusion de débruitage, une approche influencée par la thermodynamique non équilibre. Cette méthode démonte systématiquement la structure des données et la restaure ensuite. Cette approche a été adaptée pour la génération d’images par Ho et al. en 2020, conduisant à la création des modèles de diffusion que nous voyons aujourd’hui.

La formation de modèles de diffusion implique deux étapes principales. Initialement, le processus de diffusion ou de débruitage implique l’ajout progressif de bruit aléatoire à l’image d’entrée jusqu’à ce qu’elle se transforme complètement en bruit. Ce processus est régi par une chaîne de Markov fixe, qui ajoute systématiquement du bruit gaussien sur plusieurs étapes consécutives.

Démonstration du fonctionnement de Midjourney

Par la suite, dans la phase de reconstruction ou de reconstruction inverse, le modèle restaure les données originales à partir de l’état dominé par le bruit atteint lors du processus de diffusion. Ce processus est conduit par une chaîne de Markov avec des transitions gaussiennes apprises, impliquant que la prédiction de la densité de probabilité à un moment donné dépend uniquement de l’état atteint à l’étape de temps précédente. Comme les variables latentes ‘x1, …, xT’ partagent la même dimensionnalité que les données, les modèles de diffusion sont classés comme modèles de variables latentes.

Coût et abonnement de Mid-Journey

Alors que de nombreux chatbots comme ChatGPT et Bing Chat offrent une utilisation presque illimitée gratuite, la situation diffère pour les générateurs d’images comme Mid-Journey. En raison de la puissance de calcul considérable requise, en particulier des unités de traitement graphique (GPU) et de l’utilisation de la mémoire vidéo pour le processus de débruitage, le service de Mid-Journey est assorti d’un prix.

Le plan de base commence à 10 $ par mois, offrant environ 3,3 heures de temps de processeur graphique, suffisant pour environ 200 générations d’images. Cependant, il existe des plans plus avancés offrant des images illimitées en mode Relaxed, bien qu’avec un temps d’attente plus long.

Configuration de votre MidJourney

  1. Commencer avec MidJourney implique de s’inscrire sur leur site Web officiel, de souscrire à un plan, puis d’être redirigé vers Discord.
  2. Une fois que vous avez localisé le canal Mid-Journey sur Discord, naviguez jusqu’aux groupes de nouveaux arrivants sur le côté gauche. De là, vous pouvez observer d’autres utilisateurs créant des prompts, apprendre les mécanismes de Mid-Journey et interagir dans un environnement animé.
  3. Après vous être familiarisé avec l’environnement, invitez le bot dans votre serveur privé pour créer des images sans distraction. Le bot génère quatre images de prévisualisation en fonction de votre prompt, vous permettant de sélectionner la correspondance la plus proche de votre idée originale et de raffiner davantage l’image.

Structure de prompt pour Midjourney

  1. La commande /imagine dans un canal Discord à l’intérieur du canal Midjourney génère une image unique à partir d’une brève description texte (prompt).
  2. Pour recréer un style spécifique à travers plusieurs images, insérez simplement l’URL de l’image avec votre prompt texte. Vos nouvelles sorties cohérentes fusionneront des éléments de votre image choisie et de votre texte.
    /imagine http://lien-vers-votre-image <description de l’image> –paramètre1 –paramètre2
    Vous pouvez générer un lien vers votre image en la téléchargeant sur le canal Discord. Une fois téléchargée, cliquez avec le bouton droit sur l’image et sélectionnez ‘Copier le lien’.
    Ici, http://lien-vers-votre-image et les paramètres sont facultatifs.
  3. Par la suite, le bot se met au travail sur votre image, prenant environ une minute pour offrir quatre alternatives. Ce processus implique l’utilisation de puissantes unités de traitement graphique (GPU) pour traiter et interpréter chaque prompt.
  4. Surveillez votre utilisation de GPU en utilisant la commande /info. Elle vous permet de vérifier votre ‘Temps de traitement rapide restant’ et de surveiller le temps de processeur graphique de votre abonnement.

Prompt /info Midjourney

Mise à l’échelle et modifications d’images

Pour une image plus raffinée, utilisez les boutons ‘U’ sous les images pour mettre à l’échelle votre choix préféré. Vous pouvez également utiliser les boutons ‘V’ pour apporter des ajustements à des images spécifiques. Pour des modifications supplémentaires sur une image mise à l’échelle, utilisez les options ‘Créer des variations’, ‘Révision de la mise à l’échelle légère’ et ‘Révision de la mise à l’échelle bêta’. Le bouton ‘Web’ vous permet de visualiser l’image dans une fenêtre distincte à une taille plus grande.

Midjourney permet la mise à l’échelle d’images jusqu’à 2048×2048 (carré) et 2720×1530 (écran large) en résolution via sa fonction de révision de la mise à l’échelle bêta, avec une taille de grille de génération par défaut de 1024×1024 (carré) et 1456×816 (écran large). Chaque image peut être améliorée grâce aux options de mise à l’échelle ‘U’, qui améliorent des parties spécifiques de l’image.

Regardez ce prompt qui produit un artwork fantastique avec la version 5.2 de Midjourney.

/imagine L’artwork représente un arbre solitaire sous un ciel étoilé, avec un enfant lisant en dessous, dans les teintes de bleu serein et d’orange chaud, inspiré par les pinceaux de l’impressionnisme français, les miniatures persanes, la simplicité du Bauhaus, évoquant les illustrations classiques des contes de fées pour enfants, réalisant une harmonie asymétrique, exprimée dans un style enchanteur, folk/naïf : –ar 15:19 –upbeta –q 2

Exemple de guide de prompt Midjourney

Création de votre premier art Midjourney AI

  1. Création de la feuille de route de base : Imaginez-vous en tant qu’artiste. Commencez par une description simple et vivante de l’image que vous aspirez à donner vie. Définissez le sujet principal, l’ambiance ou même les détails minimes que vous souhaitez intégrer. Utilisez des signes de ponctuation tels que des virgules, des crochets et des tirets pour structurer vos pensées. Pour de meilleurs résultats, soyez explicite sur le contexte et les détails de votre conception. Des éléments tels que le sujet (par exemple, dragon, voiture ancienne, Abraham Lincoln), le médium (par exemple, art numérique, dessin au crayon), l’environnement (par exemple, espace, sous-marin, ville animée), l’éclairage (par exemple, doux, néon, contre-jour), la couleur (par exemple, teintes de terre, vibrantes, assourdies), l’humeur (par exemple, mélancolique, capricieux, paisible) et la composition (par exemple, paysage, gros plan, grand angle) peuvent être critiques. Exemples :
    • Une forêt idyllique baignée de lumière solaire, un chemin sinueux qui s’étend dans le lointain
    • Une ville qui ne dort jamais, avec des lumières néon réfléchies sur les trottoirs et une foule diverse qui se presse
  2. Intégration de style et de mots-clés : L’IA de Midjourney est capable d’illustrer des images dans une myriade de styles tels que l’abstrait, le surréaliste ou le réaliste. En intégrant un style ou des mots-clés, vous pouvez guider l’IA pour créer une image qui reflète votre vision. Expérimentez avec divers styles et mots-clés pour découvrir le mélange parfait. Exemples :
    • Un paysage peint représentant un désert à l’aube, mirroring le style de Georgia O’Keeffe, avec une palette de couleurs pastel et des formes organiques.
    • Une représentation abstraite d’une forêt paisible, avec des motifs géométriques formant des arbres et des feuillages, inspirée par les compositions de Piet Mondrian.
  3. Utilisation des paramètres avancés : Considérez Midjourney comme votre boîte à outils créative, regorgeant de paramètres avancés qui vous permettent d’affiner vos images générées. C’est comme brandir une baguette magique, vous permettant de créer l’équilibre parfait entre aléatoire, stylisation et variation d’image. Libérez votre puissance créative en expérimentant avec ces paramètres jusqu’à ce que vous trouviez le mélange parfait qui résonne avec votre vision. Exemples :
    • Un jardin japonais serein avec un étang reflétant les cerisiers – graine 22 – s 150 – c 40
    • Une ville cyberpunk dystopique, illuminée par des lumières néon – graine 88 – s 600 – c 60
  4. Mise en évidence d’éléments avec des pondérations : Imaginez votre image comme une symphonie, où chaque élément contribue à l’ensemble. En utilisant la notation « :: », vous pouvez dicter l’importance de divers éléments dans votre image, vous permettant de contrôler le projecteur. Exemples :
    • [Un paon élégant] :: 3 perché sur un [arbre de glycine] :: 1 en fleurs
    • [Un éléphant majestueux] :: 2 baignant dans la lumière d’un [coucher de soleil] :: 1 dans la savane
  5. Midjourney est un processus d’essais et d’erreurs : Expérimenter avec différents éléments et fonctionnalités est nécessaire. Chaque itération vous rapprochera de l’image que vous avez imaginée pour la donner vie.

Paramètres Mid-Journey

Le modèle de Midjourney fonctionne en utilisant des paramètres ajustables qui contrôlent le résultat du processus de génération d’images. Ces paramètres permettent aux utilisateurs de personnaliser et de peaufiner leur art généré, en ajustant le modèle pour créer des sorties qui conviennent parfaitement à leur objectif.

Voici les paramètres de base et avancés, leurs fonctions et comment les utiliser pour exploiter pleinement les capacités de Midjourney :

  • Rapports d’aspect (–aspect ou –ar) : Ce paramètre contrôle le rapport entre la largeur et la hauteur de l’image générée. Par exemple, un rapport de 16:9 est idéal pour les miniatures YouTube, tandis que 1:1 produit une image carrée parfaite pour Instagram.
  • Chaos (–chaos) : Ce paramètre ajuste la diversité de la grille d’images initiale et varie de 0 à 100. Des valeurs de chaos plus élevées vous donneront des résultats imprévisibles et uniques, tandis que des valeurs plus basses assureront des résultats plus cohérents.
  • Aucun (–no) : Ce paramètre vous aide à éliminer des éléments ou des caractéristiques spécifiques de l’image générée. Par exemple, si vous voulez une image sans aucun rouge, vous pouvez utiliser « –no rouge ».
  • Qualité (–qualité ou –q) : Ce réglage ajuste le temps nécessaire pour générer une image. Une qualité plus élevée nécessite plus de temps de traitement mais offre des détails plus précis. Ce paramètre peut prendre des valeurs de 0,25, 0,5, 1 ou 2.
  • Graine (–graine) : Ce paramètre détermine le bruit visuel initial, servant de base pour l’image générée. Utiliser le même numéro de graine avec le même prompt vous donnera des résultats similaires. Il accepte des valeurs entières comprises entre 0 et 4294967295.
  • Arrêt (–stop) : Avec ce paramètre, vous pouvez interrompre prématurément un travail, produisant des résultats moins détaillés mais potentiellement intéressants. La plage est de 10 à 100. Par exemple, si vous spécifiez « –stop 50 », le processus de génération d’images s’arrêtera à 50 % d’achèvement, aboutissant à une image moins détaillée, peut-être abstraite.
  • Styliser (–styliser ou –s) : Ce paramètre contrôle le niveau d’application artistique sur l’image générée. Des valeurs de stylisation plus faibles produisent des résultats plus proches du prompt initial, tandis que des valeurs plus élevées aboutissent à des interprétations plus abstraites et artistiques. Dans la version 5, la valeur par défaut est 100, mais vous pouvez la régler entre 0 et 1000.
  • Version du modèle : Vous pouvez sélectionner parmi différentes versions du modèle Midjourney en utilisant le paramètre –version ou –v.
  • Niji : Un modèle spécialisé dans les images de style anime. Il peut être accédé en utilisant le paramètre –niji.
  • Haute définition : Pour les images abstraites et les paysages, le paramètre –hd active une version de modèle plus ancienne qui produit des images plus grandes et moins cohérentes.
  • Modèles de test : Midjourney propose des modèles spéciaux pour des cas d’utilisation spécifiques. Les paramètres –test et –testp activent les modèles de test standard et ceux axés sur la photographie, respectivement.
  • Mise à l’échelle : L’algorithme Midjourney commence avec une grille d’images à basse résolution. Il propose plusieurs modèles de mise à l’échelle pour améliorer la taille et les détails de l’image.
    • Uplight : Un metteur à l’échelle de lumière alternative (–uplight) fournit des images mises à l’échelle moins détaillées mais plus lisses.
    • Upbeta : Le paramètre –upbeta conduit à des images avec nettement moins de détails supplémentaires, restant plus proche de la grille d’images d’origine.
    • Upanime : Le metteur à l’échelle –upanime est conçu spécifiquement pour fonctionner avec le modèle Midjourney –niji.
  • Poids de l’image : Utilisez –iw pour ajuster le poids du prompt d’image par rapport au poids du texte. La valeur par défaut est 0,25.
  • Sameseed : Le paramètre –sameseed garantit que toutes les images de la grille initiale utilisent le même bruit de départ, créant des images générées très similaires.
  • Vidéo : Midjourney peut enregistrer une vidéo de progression du processus de génération de la grille d’images initiale en utilisant le paramètre –video.
  • Créatif : Avec le paramètre –créatif, les modèles de test et de testp produisent des images plus variées et créatives.

Midjourney met régulièrement à jour ses fonctionnalités pour améliorer l’expérience utilisateur, la dernière version étant la 5.2, lancée en juin 2023. En ajoutant –v 5.2 à votre prompt ou en la sélectionnant via la commande /settings, les utilisateurs peuvent accéder à ce modèle avancé. La version 5.2 offre une meilleure détection des détails d’images et une compréhension plus intuitive des prompts, apportant des couleurs plus vives et des compositions améliorées.

Comprendre les droits d’auteur pour les œuvres d’art générées par l’IA

Image Midjourney de mélange d'IA et de lois sur le droit d'auteur

En mars 2023, le Bureau des droits d’auteur des États-Unis a clarifié sa position sur la protection par droit d’auteur des œuvres générées par l’IA. La politique stipule que, même si les éléments créés par l’homme dans les créations IA (comme les écrits ou les conceptions uniques) peuvent être protégés, les images produites par l’IA ne sont pas éligibles au droit d’auteur, conformément aux normes mondiales qui ne protègent que les créations humaines.

Dans le contexte de l’art IA, le droit d’auteur n’est pas simple. Alors que l’art numérique comporte une contribution humaine, l’art généré par l’IA est créé sans intervention humaine directe, ce qui complique la question de l’auteur et de la propriété. Selon le Bureau des droits d’auteur des États-Unis, la propriété initiale est accordée à l’auteur de l’œuvre – un créateur humain. Cependant, comme l’IA ne peut pas être considérée comme un auteur, l’art généré par l’IA manque de propriété claire.

Les dernières directives du Bureau des droits d’auteur des États-Unis permettent de protéger par droit d’auteur l’art IA uniquement lorsqu’il contient une autorité humaine suffisante. Le niveau d’« autorité humaine suffisante » reste indéfini et dépend du degré d’implication humaine dans la création de l’œuvre d’art IA.

Il est intéressant de noter que Midjourney, une plateforme basée sur l’IA pour la création d’images, a établi ses propres politiques pour les droits d’utilisation. Les utilisateurs d’essai gratuit peuvent utiliser les images à des fins non commerciales sous la licence Creative Commons Attribution-NonCommercial 4.0 International (CC BY-NC 4.0), avec les crédits appropriés à Midjourney. Cependant, les abonnés payants peuvent utiliser les images à des fins commerciales sous les Conditions commerciales générales. Ce développement dans l’espace du droit d’auteur présente une dynamique intrigante entre la créativité humaine et l’IA.

Utilisation de Midjourney pour des conceptions UI dynamiques et la génération de logos créatifs

Que ce soit pour concevoir des interfaces utilisateur intuitives pour des sites Web ou des applications mobiles, ou pour créer des logos et des bannières uniques, Midjourney donne le pouvoir aux créateurs de contenu en générant une gamme d’alternatives de conception en quelques secondes.

Voici comment cela fonctionne. Chaque conception commence par un prompt, agissant comme une feuille de route pour l’IA à suivre. Supposons que vous conceviez une interface utilisateur pour une application de plateforme d’enseignement en ligne. Un prompt typique pourrait être : « /imagine Interface utilisateur de la plateforme d’enseignement en ligne, Dribbble, Haute Résolution, 4K, comme Khan Academy ».

Les résultats initiaux ne correspondront peut-être pas parfaitement. Par exemple, l’ajout de « Adobe XD » dans le mélange peut aider Midjourney à adapter ses conceptions pour être plus compatibles avec Adobe XD. Un prompt optimisé serait :

/imagine Plateforme d’enseignement en ligne, interface utilisateur, Adobe XD, Dribbble, Haute Résolution, 4K, conception minimaliste

Image Midjourney de conceptions UI/UX de bureau

 

Logo ou bannières inspirés du texte en utilisant Midjourney

Explorons comment créer une bannière avec un logo pour UNITE AI.

Tout d’abord, vous devez avoir une image simple du texte que vous souhaitez afficher. Vous pouvez créer cela à l’aide d’un outil de conception graphique ou d’un éditeur de texte et le télécharger sur votre canal Discord.

Exemple de texte pour le logo UNITE
Une image simple de texte utilisée pour créer le logo UNITE

Le prompt pour créer la bannière est :

/imagine Lettres : <lien vers une image simple du texte à afficher> UNITE dans une police de caractères futuriste, inspirée par l’IA, logo avec les lettres UNITE –v 5 –ar 16:9

Guide de prompt Midjourney : Écran de fonctionnalité

Regardez ces exemples de prompts pour plus d’idées :

/imagine Un musicien solitaire jouant une mélodie sereine sur une ville flottante au crépuscule, dans le style art nouveau

Guide de prompt Midjourney : Image d'art indien

 

/imagine Une image d’une personne du futur travaillant sur un bureau futuriste, entourée d’écrans holographiques et de technologie avancée. La personne porte un costume argenté élégant et porte des lunettes de réalité virtuelle. L’environnement est rempli de lumières néon et de hologrammes flottants. L’atmosphère est futuriste et haute technologie, avec un sentiment d’excitation et d’innovation. La caméra est un appareil photo numérique haute résolution, capturant chaque détail avec précision. Le style artistique est un mélange de cyberpunk et de minimalisme, avec un accent sur les lignes nettes et les couleurs vives. Les réalisateurs, les directeurs de la photographie, les photographes, les designers de mode, les caricaturistes et les artistes collaborant dans cette juxtaposition unique sont Christopher Nolan, Roger Deakins, Annie Leibovitz, Virgil Abloh, Hayao Miyazaki et Kaws.

Prompt Midjourney pour une personne du futur travaillant

/imagine Barbie dans les années 40 en tant qu’infirmière de guerre, dans un hôpital militaire vintage, soignant les soldats blessés, dans le style des illustrations classiques de Mattel, avec l’atmosphère de la photographie en sépia de la Seconde Guerre mondiale 8k –v 5 –ar 16:9

Guide de prompt Midjourney : Image de Barbie dans des contextes uniques

/imagine Un cadre d’une femme appuyée contre une moto volante, style cyberpunk, paysages urbains s’étendant, 32k, détails d’espaceport intriqués, panoramas de gratte-ciel fugaces, lisse

Image Midjourney de style cyberpunk de fille

 

Pensées finales : Naviguer dans le monde de l’art IA avec Midjourney

Rappelez-vous, « Une image vaut mille mots ». Une description détaillée et vibrante peut faire des merveilles. Oui, Midjourney n’est pas gratuit à utiliser. Pourtant, il révolutionne le monde de l’art et élargit nos possibilités créatives grâce à sa technologie d’IA texte-à-image de pointe. Avec la capacité de convertir un simple prompt texte en une image haute résolution, c’est un outil qui promet des opportunités sans fin, non seulement pour les artistes, mais également pour les concepteurs UI/UX, les enthousiastes de la technologie et les professionnels de l’IA.

Voici quelques points essentiels à retenir lors de votre aventure Midjourney :

  • Apprenez les bases du prompt Midjourney : Utilisez des descriptions claires, succinctes et complètes qui encapsulent votre vision pour guider efficacement l’IA. Rappelez-vous de considérer votre public cible et n’hésitez pas à expérimenter avec divers styles, humeurs et contextes.
  • Utilisez les paramètres : Améliorez votre expérience créative en exploitant la multitude de paramètres avancés que Midjourney offre. De la gestion du rapport d’aspect à l’ajustement du paramètre de chaos pour des résultats uniques, chaque détail peut être personnalisé selon vos préférences.
  • Adoptez le processus itératif : Votre première œuvre d’art générée par l’IA ne sera peut-être pas parfaite. Adoptez ce processus itératif et apprenez à affiner et à optimiser vos prompts pour de meilleurs résultats.
  • Comprenez les implications en matière de droit d’auteur : Même si les œuvres d’art générées par l’IA ne sont pas éligibles au droit d’auteur, les composants créés par l’homme à l’intérieur peuvent être protégés.

En essence, l’intégration de l’IA dans l’art a démocratisé la créativité et a brouillé les frontières entre les chefs-d’œuvre humains et ceux créés par la machine. Alors que nous continuons à être témoins de la croissance remarquable de l’IA générative sur le marché de l’art, il est indéniable que la révolution de l’art IA, menée par des plateformes comme Midjourney, est juste beginning.

J'ai passé les cinq dernières années à plonger dans le monde fascinant de l'apprentissage automatique et du deep learning. Ma passion et mon expertise m'ont conduit à contribuer à plus de 50 projets de génie logiciel divers, avec un focus particulier sur l'IA/ML. Ma curiosité continue m'a également attiré vers le traitement automatique des langues, un domaine que je suis impatient d'explorer plus en profondeur.