Modele și platforme AI

LucidDreamer: Generare Text-to-3D de Înaltă Fidelitate prin Interval Score Matching

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Progresele recente în cadrul cadrelor generative de inteligență artificială text-to-3D au marcat un moment semnificativ în modelele generative. Ele deschid calea pentru noi posibilități în crearea de active 3D în diverse scenarii din lumea reală. Activele digitale 3D dețin în prezent un loc indispensabil în prezența noastră digitală, permițând o vizualizare cuprinzătoare și interacțiune cu medii și obiecte complexe care reflectă experiențele noastre din lumea reală. Aceste cadre generative de inteligență artificială 3D sunt aplicate în diverse domenii, incluzând animație, arhitectură, jocuri, realitate augmentată și virtuală și multe altele. De asemenea, ele sunt utilizate pe scară largă în conferințe online, retail, educație și marketing.

Cu toate acestea, în ciuda promisiunilor aduse de aceste progrese în cadrele generative text-to-3D, utilizarea pe scară largă a tehnologiilor 3D vine cu o problemă majoră. Generarea de imagini și conținut media 3D de înaltă calitate necesită în continuare timp, efort, resurse și expertiză specializată. Chiar și atunci când aceste cerințe sunt îndeplinite, generarea text-to-3D adesea nu reușește să producă modele 3D detaliate și de înaltă calitate. Această problemă de renderizare și de generare 3D de calitate scăzută este mai prevalentă în cadrele care utilizează metoda Score Distillation Sampling (SDS). Acest articol va discuta despre deficiențele notabile observate în modelele care utilizează metoda SDS, care introduc incoerențe și direcții de actualizare de calitate scăzută, rezultând într-un efect de supra-netezire a ieșirii generate. De asemenea, vom introduce cadrul LucidDreamer, o abordare nouă care utilizează metoda Interval Score Matching (ISM) pentru a depăși problema de supra-netezire. Vom explora arhitectura modelului și performanța sa în comparație cu cadrele generative text-to-3D de ultimă generație. Așadar, să începem.

LucidDreamer3D : O Introducere în Generarea 3D Utilizând Interval Score Matching

Un motiv major pentru care modelele de generare 3D au fost subiectul de discuție în industria inteligenței artificiale generative este datorită aplicațiilor lor largi în diverse domenii și industrii, precum și a capacității lor de a produce conținut 3D în timp real. Datorită aplicațiilor lor practice largi, dezvoltatorii au propus numeroase abordări pentru generarea de conținut 3D, dintre care cadrele generative text-to-3D se remarcă prin capacitatea lor de a utiliza doar descrieri text pentru a genera modele 3D imaginative. Cadrele generative text-to-3D realizează acest lucru prin utilizarea unui model de difuzie imagine-text preantrenat pentru a supraveghea antrenarea unui model neural parametrizat 3D, permițând astfel renderizarea de imagini 3D consecvente care se aliniază cu textul. Această capacitate de a renderiza imagini 3D constante se bazează pe utilizarea fundamentală a metodei Score Distillation Sampling, și permite SDS să acționeze ca mecanismul de bază pentru a aduce rezultatele 2D din modelele de difuzie în echivalentele lor 3D, permițând astfel antrenarea de modele 3D fără a utiliza imagini de antrenament. În ciuda eficacității lor, cadrele generative de inteligență artificială 3D care utilizează metoda SDS suferă adesea de distorsiuni și probleme de supra-netezire care împiedică implementările practice ale generării 3D de înaltă fidelitate.

Pentru a aborda problemele de supra-netezire, cadrul LucidDreamer implementează o abordare ISM sau Interval Score Matching, o abordare nouă care utilizează două mecanisme eficiente. În primul rând, abordarea ISM utilizează metoda de inversare DDIM pentru a mitigă efectul de mediere cauzat de incoerențele pseudo-Adevărului de bază prin producerea unei traiectorii de difuzie inversabile. În al doilea rând, în loc de a se potrivi imagini renderizate de modelul 3D cu pseudo-Adevărurile de bază, metoda ISM le potrivește între două pași de interval în traiectoria de difuzie, ceea ce îi ajută să evite o eroare de reconstrucție ridicată prin evitarea reconstrucției într-un singur pas. Utilizarea ISM în loc de SDS conduce la o performanță consistentă și ridicată, cu ieșiri realiste și detaliate.

În general, cadrul LucidDreamer își propune să aducă următoarele contribuții în domeniul inteligenței artificiale generative 3D

  1. Oferă o analiză detaliată a SDS, conceptul fundamental în cadrele generative text-to-3D, și identifică limitările sale cheie, cum ar fi pseudo-Adevărurile de calitate scăzută, și oferă o explicație pentru efectul de supra-netezire cu care se confruntă aceste cadre generative 3D.
  2. Pentru a contracara limitările impuse de abordarea SDS, cadrul LucidDreamer introduce Interval Score Matching, o abordare nouă care utilizează potrivirea bazată pe intervale și traiectorii de difuzie inversabile pentru a depăși SDS prin producerea de ieșiri realiste și detaliate.
  3. Atinge performanța de ultimă generație prin integrarea metodei ISM cu Splatting Gaussian 3D pentru a depăși metodele existente de generare de conținut 3D cu costuri de antrenament scăzute.

Limitări ale SDS

Așa cum s-a menționat anterior, SDS este una dintre cele mai populare abordări pentru modelele generative text-to-3D, și căută moduri pentru post-prior condițional în spațiul latent al DDPM. Abordarea SDS adoptă, de asemenea, un model DDPM preantrenat pentru a modela posteriorul condițional, și urmărește să distileze reprezentările 3D pentru posteriorul condițional, realizat prin minimizarea divergenței KL. Abordarea SDS reutilizează, de asemenea, obiectivul de potrivire a scorului de zgomot ponderat pentru antrenarea DDP. Obiectivul principal al abordării SDS poate fi văzut ca fiind acela de a se potrivi cu vederea modelului 3D cu pseudo-adevărul de bază estimat de DDPM într-un singur pas, deși procesul de distilare adesea ignoră aspecte cheie ale componentei DDPM, și figura următoare demonstrează cum un model DDPM preantrenat tinde să prezică pseudo-adevăruri de bază cu caracteristici incoerente, și produce ieșiri de calitate scăzută în timpul procesului de distilare.

Cu toate acestea, direcțiile de actualizare în circumstanțe nedorite sunt actualizate către reprezentări 3D care conduc, în cele din urmă, la rezultate supra-netezite. Mai mult, este demn de remarcat că componenta DDPM este sensibilă la intrare, și caracteristicile pseudo-adevărului de bază se schimbă semnificativ chiar și cu o schimbare minoră a intrării. În plus, aleatoriu în ceea ce privește poza camerei și componenta de zgomot a intrărilor poate adăuga la fluctuații care sunt inevitabile în timpul distilării. Optimizarea intrării pentru pseudo-adevăruri de bază incoerente conduce la rezultate medii. Ce este mai mult, abordarea SDS obține pseudo-adevăruri de bază cu o predicție într-un singur pas pentru toate intervalele de timp, și nu ia în considerare limitările unei componente DDPM cu un singur pas, care nu este capabilă să producă ieșiri de calitate ridicată, ceea ce indică faptul că distilarea activelor 3D sau a imaginilor cu componenta SDS nu poate fi cea mai ideală abordare.

LucidDreamer : Metodologie și Funcționare

Cadrul LucidDreamer introduce, de fapt, abordarea ISM, dar se bazează și pe învățămintele din alte cadre, incluzând modelele generative text-to-3D, modelele de difuzie și cadrele de reprezentare 3D diferențiabile. Cu toate acestea, să aruncăm o privire detaliată asupra arhitecturii și metodologiei cadrului LucidDreamer.

Interval Score Matching sau ISM

Problemele de supra-netezire și de calitate scăzută a ieșirii cu care se confruntă majoritatea cadrelor generative text-to-3D pot fi atribuite utilizării abordării SDS, care urmărește să se potrivească pseudo-adevărului de bază cu reprezentările 3D, care este incoerent și adesea de calitate scăzută. Pentru a contracara problemele cu care se confruntă SDS, cadrul LucidDreamer introduce ISM sau Interval Score Matching, o abordare nouă care are două etape de funcționare. În prima etapă, componenta ISM obține pseudo-adevăruri de bază mai consistente în timpul distilării, indiferent de aleatoriu în pozele camerei și zgomot. În a doua etapă, cadrul generează pseudo-adevăruri de bază de calitate superioară.

O altă limitare majoră a SDS este generarea de pseudo-adevăruri de bază cu o predicție într-un singur pas pentru toate intervalele de timp, ceea ce face dificilă garantarea pseudo-adevărurilor de bază de calitate ridicată, și formează baza pentru a îmbunătăți calitatea vizuală a pseudo-adevărurilor de bază. Într-un sens similar, obiectivul SDS poate fi văzut ca fiind acela de a se potrivi cu vederea modelului 3D cu pseudo-adevărul de bază estimat de DDPM într-un singur pas, deși procesul de distilare adesea ignoră un aspect critic al componentei DDPM, și anume producerea de pseudo-adevăruri de bază de calitate scăzută cu caracteristici incoerente în timpul procesului de distilare.

În general, componenta ISM promite să ofere mai multe avantaje față de metodele anterioare utilizate în modelele generative text-to-3D. În primul rând, datorită capacității ISM de a furniza pseudo-adevăruri de bază de calitate ridicată în mod constant, este capabilă să producă ieșiri de distilare de înaltă fidelitate cu structuri fine și detalii bogate, eliminând astfel nevoia de o scală de ghidare pe scară largă și îmbunătățind flexibilitatea pentru crearea de conținut 3D. În al doilea rând, trecerea de la abordarea SDS la abordarea ISM are o suprasarcină computațională marginală, în special deoarece abordarea ISM nu compromite eficiența generală, chiar dacă necesită costuri computaționale suplimentare pentru inversările DDIM.

Figura de mai sus demonstrează funcționarea abordării ISM și oferă o imagine de ansamblu asupra arhitecturii cadrului LucidDreamer. Cadrul inițializează mai întâi Splattingul Gaussian, adică reprezentările 3D, utilizând un generator text-to-3D preantrenat cu un prompt. Acesta este apoi încorporat cu un component DDPM 2D preantrenat pentru a deranja vederi aleatorii către traiectorii latente necondiționate utilizând inversările DDIM, și apoi actualizează cu scorul de interval. Datorită arhitecturii sale, nucleul optimizării componentei ISM se concentrează pe actualizarea reprezentărilor 3D către pseudo-adevăruri de bază de calitate ridicată și consistente din punct de vedere al caracteristicilor, dar prietenoase din punct de vedere computațional. Acest principiu este ceea ce permite ISM să se alinieze cu obiectivele fundamentale ale abordării SDS, în timp ce rafinează metoda existentă.

Inversarea DDIM

Cadrul LucidDreamer urmărește să producă pseudo-adevăruri de bază mai consistente, aliniate cu reprezentările 3D. Prin urmare, în loc să producă reprezentări 3D, cadrul LucidDreamer utilizează abordarea de inversare DDIM pentru a prezice reprezentări latente de zgomot 3D și pentru a prezice o traiectorie latentă de zgomot inversabilă în mod iterativ. Mai mult, datorită inversabilității inversării DDIM, cadrul LucidDreamer este capabil să crească consistența pseudo-adevărului de bază în mod semnificativ pentru toate intervalele de timp.

Pipeline Avansat de Generare

Cadrul LucidDreamer introduce, de asemenea, un pipeline avansat, pe lângă ISM, pentru a explora factorii care afectează calitatea vizuală a generării text-to-3D, și introduce Splatting Gaussian 3D sau 3DGS ca model de generare 3D și generare de nori de puncte 3D pentru inițializare.

Splatting Gaussian 3D

Lucrările existente au indicat că creșterea dimensiunii lotului și a rezoluției de renderizare pentru antrenament îmbunătățește calitatea vizuală în mod semnificativ. Cu toate acestea, majoritatea reprezentărilor 3D învățabile adoptate pentru generarea text-to-3D sunt consumatoare de timp și memorie. Pe de altă parte, abordarea Splatting Gaussian 3D oferă rezultate eficiente atât în ceea ce privește optimizarea, cât și renderizarea, ceea ce permite pipeline-ului avansat de generare din cadrul LucidDreamer să atingă dimensiuni mari de lot și renderizare de înaltă rezoluție, chiar și atunci când funcționează cu resurse computaționale limitate.

Inițializare

Majoritatea cadrelor generative text-to-3D de ultimă generație inițializează reprezentările 3D cu geometrii limitate, cum ar fi cercuri, cutii sau cilindri, care adesea conduc la ieșiri nedorite pentru obiecte simetrice neaxiale. Pe de altă parte, deoarece cadrul LucidDreamer introduce Splatting Gaussian 3D ca reprezentări 3D, cadrul poate adopta cu ușurință diverse cadre generative text-to-punct pentru a genera o inițializare grosieră cu intrări umane. Strategia de inițializare îmbunătățește în mod semnificativ viteza de convergență.

LucidDreamer : Experimente și Rezultate

Generare Text-to-3D

Figura de mai sus demonstrează rezultatele generate de modelul LucidDreamer cu abordarea de difuzie stabilă originală, în timp ce figura următoare vorbește despre rezultatele generate pe puncte de finisare diferite.

Așa cum se poate vedea, cadrul LucidDreamer este capabil să genereze conținut 3D foarte consistent utilizând textul de intrare și cue-urile semantice. Mai mult, cu utilizarea ISM, cadrul LucidDreamer generează imagini intricate și mai realiste, evitând probleme comune, cum ar fi suprasaturarea sau supra-netezirea, și excelează în generarea de obiecte comune, precum și în susținerea creațiilor creative.

Generalizabilitatea ISM

Pentru a evalua generalizabilitatea ISM, a fost efectuată o comparație între ISM și SDS în ceea ce privește reprezentările explicite și implicite, și rezultatele sunt prezentate în imaginea următoare.

Comparație Calitativă

Pentru a analiza eficiența calitativă a cadrului LucidDreamer, a fost comparat cu modelele de referință actuale, și pentru a asigura o comparație corectă, a fost utilizat cadrul de difuzie stabilă 2.1 pentru distilare, și rezultatele sunt prezentate în imaginea următoare. Așa cum se poate vedea, cadrul livrează rezultate de înaltă fidelitate și geometric precise, consumând mai puține resurse și timp.

Mai mult, pentru a oferi o evaluare mai cuprinzătoare, dezvoltatorii au efectuat, de asemenea, un studiu cu utilizatori. Evaluarea a selectat 28 de prompturi și a utilizat diferite abordări de generare text-to-3D pentru fiecare prompt pentru a genera obiecte. Rezultatele au fost apoi clasificate de către utilizatori pe baza gradului de aliniere cu promptul de intrare și a fidelității sale.

LucidDreamer : Aplicații

Datorită performanței sale excepționale într-o gamă largă de sarcini de generare text-to-3D, cadrul LucidDreamer are mai multe aplicații potențiale, incluzând generarea de avataruri zero-shot, generarea personalizată text-to-3D și editarea 2D și 3D zero-shot.

Imaginea din stânga sus demonstrează potențialul LucidDreamer în sarcinile de editare 2D și 3D zero-shot, în timp ce imaginile din stânga jos demonstrează capacitatea cadrului de a genera ieșiri text-to-3D personalizate cu LoRA, în timp ce imaginea din dreapta prezintă capacitatea cadrului de a genera avataruri 3D.

Gânduri Finale

În acest articol, am discutat despre LucidDreamer, o abordare nouă care utilizează metoda Interval Score Matching sau ISM pentru a depăși problema de supra-netezire, și am discutat despre arhitectura modelului și performanța sa în comparație cu cadrele generative text-to-3D de ultimă generație. Am discutat, de asemenea, despre modul în care SDS sau Score Distillation Sampling, o abordare comună implementată în majoritatea cadrelor generative text-to-3D, adesea conduce la supra-netezirea imaginilor generate, și despre modul în care cadrul LucidDreamer contracarează această problemă prin introducerea unei noi abordări, abordarea ISM. Rezultatele și evaluarea indică eficacitatea cadrului LucidDreamer într-o gamă largă de sarcini de generare 3D, și despre modul în care cadrul already performează mai bine decât modelele generative 3D actuale. Performanța excepțională a cadrului deschide calea pentru o gamă largă de aplicații practice, așa cum s-a discutat deja.

"Un inginer de profesie, un scriitor din inimă". Kunal este un scriitor tehnic cu o dragoste și o înțelegere profundă a inteligenței artificiale și a învățării automate, dedicat simplificării conceptelor complexe din aceste domenii prin documentația sa captivantă și informativă.