Prompt engineering

O privire mai atentă asupra DALL-E 3 de la OpenAI

mm
Adaugă Unite.AI la sursele tale preferate pe Google
DALL·E 3

În lumea Inteligenței Artificiale Generative, a ține pasul cu ultimele noutăți este numele jocului. Și cÃĒnd vine vorba de generarea de imagini, Stable Diffusion și Midjourney erau platformele despre care toată lumea vorbea – pÃĒnă acum.

OpenAI, sprijinit de gigantul tehnologic Microsoft (MSFT ), a introdus DALL·E 3 pe 20 septembrie 2023.

DALL-E 3 nu este doar despre crearea de imagini; este despre aducerea ideilor tale la viață, exact așa cum le-ai imaginat. Și cel mai bun lucru? Este rapid, foarte rapid. Ai o idee, o introduci ÃŪn DALL-E 3 și, boom, imaginea ta este gata.

Deci, ÃŪn acest articol, vom explora ÃŪn profunzime ce este DALL-E 3. Vom discuta despre modul ÃŪn care funcționează, ce ÃŪl diferențiază de restul și de ce ar putea fi exact instrumentul de care ai nevoie. Indiferent dacă ești designer, artist sau pur și simplu o persoană cu multe idei cool, vei vrea să rămÃĒi aici pentru asta. Hai să ÃŪncepem.

Ce este nou cu DALL·E 3 este că ÃŪnțelege contextul mult mai bine decÃĒt DALL·E 2. Versiunile anterioare ar fi putut să rateze unele detalii sau să ignore unele aspecte, dar DALL·E 3 este pe punct. Acesta prinde exact detaliile a ceea ce ceri, oferindu-ți o imagine care este mai aproape de ceea ce ai imaginat.

Partea cool? DALL·E 3 și ChatGPT sunt acum integrate ÃŪmpreună. Ele lucrează ÃŪmpreună pentru a-ți ajuta să rafinezi ideile. ÃŽČ›i introduci un concept, ChatGPT te ajută să ÃŪl perfecționezi, iar DALL·E 3 ÃŪl aduce la viață. Dacă nu ÃŪți place imaginea, poți cere ChatGPT să ajusteze promptul și să ÃŪl facă din nou cu DALL·E 3. Pentru o taxă lunară de 20$, ai acces la GPT-4, DALL·E 3 și multe alte funcții cool.

Bing Chat de la Microsoft a primit DALL·E 3 chiar ÃŪnainte ca ChatGPT de la OpenAI să o facă, iar acum nu doar marile ÃŪntreprinderi, ci toată lumea poate să se joace cu el gratuit. Integrarea ÃŪn Bing Chat și Bing Image Creator face ca utilizarea lui să fie mult mai ușoară pentru oricine.

Ascensiunea modelelor de difuzie

În ultimii 3 ani, inteligența artificială vizuală a asistat la apariția modelelor de difuzie, făcÃĒnd un salt semnificativ, mai ales ÃŪn generarea de imagini. Înainte de modelele de difuzie, Rețelele Adversative Generative (GANs) erau tehnologia principală pentru generarea de imagini realiste.

GANs

GANs

Însă, acestea aveau propriile provocări, incluzÃĒnd nevoia de cantități uriașe de date și putere de calcul, ceea ce le făcea adesea dificil de gestionat.

Apoi au apărut modelele de difuzie. Acestea au apărut ca o alternativă mai stabilă și mai eficientă decÃĒt GANs. În contrast cu GANs, modelele de difuzie funcționează prin adăugarea de zgomot la date, ascunzÃĒndu-le pÃĒnă cÃĒnd nu rămÃĒne decÃĒt aleatoriu. Apoi, acestea lucrează ÃŪn sens invers pentru a inversa acest proces, reconstruind date semnificative din zgomot. Acest proces s-a dovedit a fi eficient și mai puțin solicitant din punct de vedere al resurselor, făcÃĒnd din modelele de difuzie un subiect fierbinte ÃŪn comunitatea AI.

Punctul de cotitură a venit ÃŪn jurul anului 2020, odată cu o serie de articole inovatoare și introducerea tehnologiei CLIP de la OpenAI, care a avansat semnificativ capacitățile modelelor de difuzie. Acest lucru le-a făcut pe modelele de difuzie excepțional de bune la sinteza text-imagin, permițÃĒndu-le să genereze imagini realiste din descrieri textuale. Aceste descoperiri nu au fost doar ÃŪn generarea de imagini, ci și ÃŪn domenii precum compoziția muzicală și cercetarea biomedicală.

Astăzi, modelele de difuzie nu sunt doar un subiect de interes academic, ci sunt utilizate ÃŪn scenarii practice, din lumea reală.

Modelarea Generativă și Straturile de Atenție: DALL-E 3

Una dintre evoluțiile cheie ÃŪn acest domeniu a fost evoluția modelării generative, cu abordări bazate pe eșantionare, cum ar fi modelarea generativă autoregresivă și procesele de difuzie, care au condus drumul. Acestea au transformat modelele text-imagin, ducÃĒnd la ÃŪmbunătățiri semnificative ale performanței. Prin descompunerea generării de imagini ÃŪn pași discreți, aceste modele au devenit mai tratabile și mai ușor de ÃŪnvățat pentru rețelele neuronale.

În paralel, utilizarea straturilor de atenție a jucat un rol crucial. Aceste straturi, ÃŪmpachetate ÃŪmpreună, au ajutat la generarea de imagini fără a necesita prejudecăți spațiale implicite, o problemă comună cu convoluțiile. Acest transfer a permis modelor text-imagin să se extindă și să se ÃŪmbunătățească ÃŪn mod fiabil, datorită proprietăților de scalare bine ÃŪnțelese ale transformatorilor.

Provocări și Soluții ÃŪn Generarea de Imagini

În ciuda acestor progrese, controlabilitatea ÃŪn generarea de imagini rămÃĒne o provocare. Probleme precum urmărirea promptului, unde modelul ar putea să nu respecte ÃŪndeaproape textul de intrare, au fost prevalente. Pentru a aborda aceasta, s-au propus abordări noi, cum ar fi ÃŪmbunătățirea captionării, menite să ÃŪmbunătățească calitatea perechilor text-imagin ÃŪn seturile de date de antrenament.

Îmbunătățirea Captionării: O Abordare Nouă

Îmbunătățirea captionării implică generarea de captionări de calitate superioară pentru imagini, ceea ce, la rÃĒndul său, ajută la antrenarea unor modele text-imagin mai precise. Acest lucru se realizează prin intermediul unui captionator de imagini robust care produce descrieri detaliate și precise ale imaginilor. Prin antrenarea pe aceste captionări ÃŪmbunătățite, DALL-E 3 a reușit să obțină rezultate remarcabile, asemănătoare cu fotografiile și lucrările de artă produse de oameni.

Antrenarea pe Date Sintetice

Conceptul de antrenare pe date sintetice nu este nou. Cu toate acestea, contribuția unică aici este ÃŪn crearea unui sistem de captionare a imaginilor nou și descriptiv. Impactul utilizării captionărilor sintetice pentru antrenarea modelelor generative a fost substanțial, conducÃĒnd la ÃŪmbunătățiri ale capacității modelului de a urma prompturi cu acuratețe.

Evaluarea DALL-E 3

Prin multiple evaluări și comparații cu modele anterioare, cum ar fi DALL-E 2 și Stable Diffusion XL, DALL-E 3 a demonstrat o performanță superioară, mai ales ÃŪn sarcinile legate de urmărirea promptului.

Comparație a modelelor text-imagin pe diverse evaluări

Comparație a modelelor text-imagin pe diverse evaluări

Utilizarea evaluărilor automate și a benchmark-urilor a oferit dovezi clare ale capacităților sale, consolidÃĒndu-și poziția ca generator text-imagin de ultimă generație.

DALL-E 3 Prompturi și Abilități

DALL-E 3 oferă o abordare mai logică și rafinată pentru crearea de imagini. Pe măsură ce derulați, veți observa cum DALL-E creează fiecare imagine, cu o combinație de acuratețe și imaginație care rezonă cu promptul dat.

În contrast cu predecesorul său, această versiune ÃŪmbunătățită excelează ÃŪn aranjarea obiectelor ÃŪntr-o scenă și ÃŪn reprezentarea caracteristicilor umane cu acuratețe, pÃĒnă la numărul corect de degete pe o mÃĒnă. Îmbunătățirile se extind și la detalii mai fine și sunt acum disponibile la o rezoluție mai mare, asigurÃĒnd un output mai realist și profesionist.

Capacitățile de renderizare a textului au fost, de asemenea, substanțial ÃŪmbunătățite. În timp ce versiunile anterioare ale DALL-E produceau texte fără sens, DALL-E 3 poate genera texte lizibile și stilizate profesional (uneori), și chiar logo-uri curate ocazional.

Înțelegerea modelului pentru cereri de imagini complexe și nuanțate a fost semnificativ ÃŪmbunătățită. DALL-E 3 poate urma acum descrieri detaliate, chiar și ÃŪn scenarii cu multiple elemente și instrucțiuni specifice, demonstrÃĒnd capacitatea sa de a produce imagini coerente și bine compuse. Să explorăm cÃĒteva prompturi și ieșirile corespunzătoare pe care le-am obținut:

Proiectează ambalajul pentru o linie de ceaiuri organice. Include spațiu pentru numele produsului și descrierea.

DALL-E 3 imagini bazate pe prompturi text

DALL-E 3 imagini bazate pe prompturi text (Notă: afișul din stÃĒnga are ortografie greșită)

Creează un banner web care anunță o vÃĒnzare de vară pentru mobilier de exterior. Imaginea prezintă o scenă de plajă cu diverse piese de mobilier de exterior și text care anunță 'Economii uriașe de vară!'

DALL-E 3 imagini bazate pe prompturi text

DALL-E 3 imagini bazate pe prompturi text

O postere vintage de călătorie pentru Paris cu text stilizat și ÃŪndrăzneț care spune 'Vizitează Paris' ÃŪn partea de jos.

DALL-E 3 imagini bazate pe prompturi text

DALL-E 3 imagini bazate pe prompturi text (Notă: ambele postere au ortografie greșită)

DALL-E 3 imagini bazate pe prompturi text

DALL-E 3 imagini bazate pe prompturi text

O scenă aglomerată a festivalului Diwali ÃŪn India, cu familii care aprind lămpi, artificii ÃŪn cer și dulciuri și decorațiuni tradiționale.
Generează o imagine a unei personalități istorice celebre, cum ar fi Cleopatra sau Leonardo da Vinci, plasată ÃŪntr-un mediu contemporan, utilizÃĒnd tehnologie modernă precum smartphone-uri sau laptop-uri.
DALL-E 3 imagini bazate pe prompturi text

DALL-E 3 imagini bazate pe prompturi text

Limitări și Risc ale DALL-E 3

OpenAI a luat măsuri semnificative pentru a filtra conținutul explicit din setul de date de antrenament al DALL-E 3, urmărind să reducă prejudecățile și să ÃŪmbunătățească ieșirile modelului. Acest lucru include aplicarea unor filtre specifice pentru categoriile de conținut sensibile și revizuirea pragurilor pentru filtrele mai largi. Stiva de atenuare include, de asemenea, multiple straturi de protecție, cum ar fi mecanismele de refuz ÃŪn ChatGPT pentru subiecte sensibile, clasificatorii de intrare de prompt pentru a preveni ÃŪncălcarea politicii, liste de blocaj pentru anumite categorii de conținut și transformări pentru a asigura că prompturile se aliniază cu ghidurile.

În ciuda progreselor sale, DALL-E 3 are limitări ÃŪn ÃŪnțelegerea relațiilor spațiale, ÃŪn renderizarea textului lung cu acuratețe și ÃŪn generarea unor imagini specifice. OpenAI recunoaște aceste provocări și lucrează la ÃŪmbunătățiri pentru versiunile viitoare.

Compania lucrează, de asemenea, la modalități de a diferenția imaginile generate de AI de cele create de oameni, reflectÃĒnd angajamentul lor față de transparență și utilizarea responsabilă a AI.

DALL·E

DALL·E 3

DALL-E 3, cea mai recentă versiune, va fi disponibilă ÃŪn faze, ÃŪncepÃĒnd cu anumite grupuri de clienți și extinzÃĒndu-se ulterior către laboratoare de cercetare și servicii API. Cu toate acestea, o dată de lansare gratuită pentru public nu a fost confirmată ÃŪncă.

OpenAI stabilește un nou standard ÃŪn domeniul inteligenței artificiale cu DALL-E 3, reunind ÃŪn mod fără efort capacități tehnice complexe și interfețe utilizator prietenoase. Integrarea DALL-E 3 ÃŪn platforme larg utilizate precum Bing reflectă o schimbare de la aplicații specializate către forme mai largi și mai accesibile de divertisment și utilitate.

Elementul care va face cu adevărat o schimbare ÃŪn următorii ani va fi, probabil, echilibrul dintre inovație și ÃŪmputernicirea utilizatorilor. Companiile care vor prospera vor fi cele care nu numai că vor ÃŪmpinge limitele a ceea ce poate face AI-ul, dar vor oferi și utilizatorilor autonomia și controlul pe care ÃŪl doresc. OpenAI, cu angajamentul său față de AI-ul etic, navighează cu atenție pe acest drum. Scopul este clar: să creeze instrumente AI care să nu fie doar puternice, ci și de ÃŪncredere și incluzive, asigurÃĒnd că beneficiile AI sunt accesibile tuturor.

Am petrecut ultimii cinci ani scufundÃĒndu-mă ÃŪn lumea fascinantă a Machine Learning și Deep Learning. Pasinea și expertiza mea m-au condus să contribui la peste 50 de proiecte diverse de inginerie software, cu un focus deosebit pe AI/ML. Curiozitatea mea ÃŪn continuare m-a atras și spre Natural Language Processing, un domeniu pe care sunt dornic să ÃŪl explorez mai departe.