Μοντέλα και πλατφόρμες AI

Zero123++: Ένα Μοντέλο Βάσης Συγκέντρωσης για Συνεπή Πολυοπτική Διαχύτη

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Τα τελευταία χρόνια, η απόδοση, η αποδοτικότητα και οι γενετικές ικανότητες των νεοεμφανιζόμενων μοντέλων AI γενετικών μοντέλων που χρησιμοποιούν εκτεταμένα σύνολα δεδομένων και πρακτικές διάχυσης 2D έχουν βιώσει μια ταχεία εξέλιξη. Σήμερα, τα μοντέλα AI γενετικών μοντέλων είναι εξαιρετικά ικανά να παράγουν διάφορες μορφές 2D και, σε κάποιο βαθμό, 3D περιεχομένου, συμπεριλαμβανομένου κειμένου, εικόνων, βίντεο, GIF και πολλά άλλα.

Σε αυτό το άρθρο, θα μιλήσουμε για το πλαίσιο Zero123++, ένα μοντέλο AI γενετικών μοντέλων που έχει ως στόχο να παράγει 3D-συνεπή πολλαπλά προβολικά εικόνες χρησιμοποιώντας μια seule προβολή εισόδου. Για να μεγιστοποιήσει το πλεονέκτημα που λαμβάνεται από τα προηγουμένως προεκπαιδευμένα γενετικά μοντέλα, το πλαίσιο Zero123++ εφαρμόζει διάφορες τεχνικές εκπαίδευσης και συνθήκων για να ελαχιστοποιήσει την ποσότητα της προσπάθειας που απαιτείται για την επιμέρους εκπαίδευση από τα προκατασκευασμένα μοντέλα διάχυσης εικόνων. Θα αναλύσουμε την αρχιτεκτονική, τη λειτουργία και τα αποτελέσματα του πλαισίου Zero123++ και θα εξετάσουμε τις ικανότητές του να παράγει συνεπή πολλαπλά προβολικά εικόνες υψηλής ποιότητας από μια seule εικόνα. Έτσι, ας ξεκινήσουμε.

Zero123 και Zero123++: Eine Εισαγωγή

Το πλαίσιο Zero123++ είναι ένα μοντέλο AI γενετικών μοντέλων που έχει ως στόχο να παράγει 3D-συνεπή πολλαπλά προβολικά εικόνες χρησιμοποιώντας μια seule προβολή εισόδου. Το πλαίσιο Zero123++ είναι μια συνέχεια του πλαισίου Zero123 ή Zero-1-to-3, που χρησιμοποιεί τεχνική σύνθεσης εικόνων zero-shot για να πιονεράσει ανοιχτά μοντέλα μετατροπής εικόνας σε 3D. Αν και το πλαίσιο Zero123++ παρέχει υποσχόμενη απόδοση, οι εικόνες που παράγονται από το πλαίσιο έχουν ορατές γεωμετρικές ασυνέπειες, και είναι ο κύριος λόγος για τον οποίο η απόσταση μεταξύ 3D σκηνών και πολλαπλών προβολικών εικόνων vẫn υπάρχει.

Το πλαίσιο Zero-1-to-3 χρησιμεύει ως βάση για διάφορα άλλα πλαισια, συμπεριλαμβανομένων των SyncDreamer, One-2-3-45, Consistent123 και πολλά άλλα, που προσθέτουν επιπλέον στρώματα στο πλαίσιο Zero123 για να λάβουν πιο συνεπή αποτελέσματα κατά την παραγωγή 3D εικόνων. Άλλα πλαισια, όπως τα ProlificDreamer, DreamFusion, DreamGaussian και πολλά άλλα, ακολουθούν μια προσέγγιση βελτιστοποίησης για να λάβουν 3D εικόνες αποσταλώντας μια 3D εικόνα από διάφορες ασυνεπείς μοντέλα. Αν και αυτές οι τεχνικές είναι αποτελεσματικές και παράγουν ικανοποιητικές 3D εικόνες, τα αποτελέσματα θα μπορούσαν να βελτιωθούν με την εφαρμογή ενός βασικού μοντέλου διάχυσης που είναι ικανό να παράγει πολλαπλά προβολικά εικόνες συνεπώς. Κατά συνέπεια, το πλαίσιο Zero123++ λαμβάνει το Zero-1-to-3 και επιμεταλλεύεται ένα νέο μοντέλο βάσης διάχυσης πολλαπλών προβολών από το Stable Diffusion.

Στο πλαίσιο Zero-1-to-3, κάθε νέα προβολή παράγεται ανεξάρτητα, και αυτή η προσέγγιση οδηγεί σε ασυνέπειες μεταξύ των προβολών που παράγονται, καθώς τα μοντέλα διάχυσης έχουν μια ιδιότητα δειγματοληψίας. Για να αντιμετωπίσουν αυτό το ζήτημα, το πλαίσιο Zero123++ εφαρμόζει μια προσέγγιση διάταξης tilings, με το αντικείμενο να περιβάλλεται από έξι προβολές σε μια seule εικόνα, και διασφαλίζει τη σωστή μοντελοποίηση για την κοινή κατανομή των πολλαπλών προβολών μιας εικόνας αντικειμένου.

Ένα άλλο σημαντικό ζήτημα που αντιμετωπίζουν οι dévelopπεurs που εργάζονται στο πλαίσιο Zero-1-to-3 είναι ότι δεν αξιοποιούν πλήρως τις ικανότητες που προσφέρονται από το Stable Diffusion, οδηγώντας σε ατελεύτητη και πρόσθετη δαπάνη. Υπάρχουν δύο κύριοι λόγοι για τους οποίους το πλαίσιο Zero-1-to-3 δεν μπορεί να αξιοποιήσει πλήρως τις ικανότητες που προσφέρονται από το Stable Diffusion

  1. Όταν εκπαιδεύεται με συνθήκες εικόνας, το πλαίσιο Zero-1-to-3 δεν ενσωματώνει αποτελεσματικά τις τοπικές ή παγκόσμιες συνθήκες που προσφέρονται από το Stable Diffusion.
  2. Κατά τη διάρκεια της εκπαίδευσης, το πλαίσιο Zero-1-to-3 χρησιμοποιεί μειωμένη ανάλυση, μια προσέγγιση στην οποία η ανάλυση εξόδου μειώνεται κάτω από την ανάλυση εκπαίδευσης, η οποία μπορεί να μειώσει την ποιότητα της παραγωγής εικόνας για τα μοντέλα Stable Diffusion.

Για να αντιμετωπίσουν αυτά τα ζητήματα, το πλαίσιο Zero123++ εφαρμόζει μια σειρά από τεχνικές συνθήκων που μεγιστοποιούν την αξιοποίηση των πόρων που προσφέρονται από το Stable Diffusion και διασφαλίζουν την ποιότητα της παραγωγής εικόνας για τα μοντέλα Stable Diffusion.

Βελτιστοποίηση Συνθηκών και Συνεπείας

Σε μια προσπάθεια να βελτιστοποιήσει τις συνθήκες εικόνας και τη συνέπεια πολλαπλών προβολών, το πλαίσιο Zero123++ εφαρμόζει διάφορες τεχνικές, με τον κύριο στόχο να επαναχρησιμοποιήσει τις προηγουμένως προεκπαιδευμένες τεχνικές από το μοντέλο Stable Diffusion.

Παραγωγή Πολλαπλών Προβολών

Η απαραίτητη ποιότητα της παραγωγής συνεπών πολλαπλών προβολών εικόνων έγκειται στη σωστή μοντελοποίηση της κοινής κατανομής πολλαπλών εικόνων. Στο πλαίσιο Zero-1-to-3, η συσχέτιση μεταξύ πολλαπλών προβολών εικόνων αγνοείται, καθώς για κάθε εικόνα, το πλαίσιο μοντελοποιεί την κατάσταση маргινάλε ανεξάρτητα και χωριστά. Ωστόσο, στο πλαίσιο Zero123++, οι dévelopπεurs έχουν επιλέξει μια προσέγγιση διάταξης tilings, που tilings 6 εικόνες σε μια seule εικόνα για συνεπή παραγωγή πολλαπλών προβολών, και η διαδικασία αποδεικνύεται στην ακόλουθη εικόνα.

Επιπλέον, έχει παρατηρηθεί ότι οι προσανατολισμοί αντικειμένων τείνουν να αποσαφηνίζονται όταν η εκπαίδευση του μοντέλου σε στάσεις κάμερας, και για να αποτρέψουν αυτήν την αποσαφηνίωση, το πλαίσιο Zero-1-to-3 εκπαιδεύεται σε στάσεις κάμερας με γωνίες υψόμετρου και σχετικές αζιμουθιακές γωνίες προς την είσοδο. Για να εφαρμόσουν αυτήν την προσέγγιση, είναι απαραίτητο να γνωρίζουν τη γωνία υψόμετρου της προβολής της εισόδου, η οποία στη συνέχεια χρησιμοποιείται για να καθορίσει τη σχετική στάση μεταξύ νέων προβολών εισόδου. Σε μια προσπάθεια να γνωρίζουν αυτήν τη γωνία υψόμετρου, τα πλαισια συχνά προσθέτουν einen εκτίμηση υψόμετρου, και αυτή η προσέγγιση συχνά έρχεται με το κόστος πρόσθετων σφαλμάτων στη διαδικασία.

Χρονοδιάγραμμα Θορύβου

Το χρονοδιάγραμμα γραμμικής κλίμακας, το αρχικό χρονοδιάγραμμα θορύβου για το Stable Diffusion, επικεντρώνεται κυρίως στις τοπικές λεπτομέρειες, αλλά όπως μπορεί να φανεί στην ακόλουθη εικόνα, έχει πολύ λίγα βήματα με χαμηλότερο SNR ή Αναλογία Σήματος προς Θόρυβο.

Αυτά τα βήματα χαμηλής Αναλογίας Σήματος προς Θόρυβο συμβαίνουν νωρίς κατά τη διάρκεια του σταδίου αποθορύβωσης, ενός σταδίου που είναι κρίσιμο για την καθορισμό της παγκόσμιας χαμηλής συχνότητας δομής. Η μείωση του αριθμού των βημάτων κατά τη διάρκεια του σταδίου αποθορύβωσης, είτε κατά τη διάρκεια της παρέμβασης είτε της εκπαίδευσης, συχνά οδηγεί σε μεγαλύτερη δομική μεταβλητότητα. Αν και αυτή η ρύθμιση είναι ιδανική για την παραγωγή εικόνας, περιορίζει την ικανότητα του πλαισίου να διασφαλίσει παγκόσμια συνέπεια μεταξύ διαφορετικών προβολών. Για να υπερβούν αυτό το εμπόδιο, το πλαίσιο Zero123++ επιμεταλλεύεται ένα μοντέλο LoRA στο πλαίσιο Stable Diffusion 2 v-prediction για να εκτελέσει μια εργασία παιχνιδιού, και τα αποτελέσματα αποδεικνύονται παρακάτω.

Με το χρονοδιάγραμμα γραμμικής κλίμακας, το μοντέλο LoRA δεν υπερβαίνει, αλλά μόνο λευκαίνει την εικόνα ελαφρά. Αντίθετα, όταν εργάζεται με το χρονοδιάγραμμα γραμμικής κλίμακας, το πλαίσιο LoRA παράγει μια κενή εικόνα επιτυχώς, ανεξάρτητα από την είσοδο prompt, υποδεικνύοντας την επίδραση του χρονοδιαγράμματος θορύβου στην ικανότητα του πλαισίου να προσαρμοστεί σε νέες απαιτήσεις παγκοσμίως.

Κλιμακωμένη Προσοχή Αναφοράς για Τοπικές Συνθήκες

Η seule προβολή εισόδου ή οι συνθήκες εικόνας στο πλαίσιο Zero-1-to-3 είναι συρραμμένες με τις θορυβώδεις εισόδους στη διασταση χαρακτηριστικών για να θορυβώσουν για την παραγωγή εικόνας.

Αυτή η συρράμωση οδηγεί σε λανθασμένη pixel-προς-pixel χωρική ανταπόκριση μεταξύ της στόχου εικόνας και της εισόδου. Για να παρέχει σωστή τοπική συνθήκη εισόδου, το πλαίσιο Zero123++ χρησιμοποιεί μια κλιμακωμένη Προσοχή Αναφοράς, μια προσέγγιση στην οποία εκτελείται ένα μοντέλο αποθορύβωσης UNet σε μια επιπλέον εικόνα αναφοράς, ακολουθούμενη από την προσάρτηση των πινάκων τιμής και της αυτοπροσοχής κλειδιού από την εικόνα αναφοράς στις αντίστοιχες στρώσεις προσοχής όταν η είσοδος του μοντέλου αποθορύβωνεται, και αυτό αποδεικνύεται στην ακόλουθη εικόνα.

Η προσέγγιση Προσοχής Αναφοράς είναι ικανή να οδηγήσει το μοντέλο διάχυσης να παράγει εικόνες που μοιράζονται παρόμοια υφή με την εικόνα αναφοράς και σεμαντική περιεχόμενο χωρίς καμία επιμέρους εκπαίδευση. Με επιμέρους εκπαίδευση, η προσέγγιση Προσοχής Αναφοράς παρέχει ανώτερα αποτελέσματα με το λανθασμένο να κλιμακώνεται.

Παγκόσμια Συνθήκη: FlexDiffuse

Στην αρχική προσέγγιση του Stable Diffusion, οι εμβυθίσεις κειμένου είναι η μόνη πηγή για παγκόσμιες εμβυθίσεις, και η προσέγγιση χρησιμοποιεί το πλαίσιο CLIP ως κωδικοποιητή κειμένου για να εκτελέσει διασταυρούμενες εξετάσεις μεταξύ των εμβυθίσεων κειμένου και των λανθασμένων του μοντέλου. Ως αποτέλεσμα, οι dévelopπεurs είναι ελεύθεροι να χρησιμοποιήσουν την ευθυγράμμιση μεταξύ των χώρων κειμένου και των εμβυθίσεων CLIP για να χρησιμοποιήσουν την παγκόσμια συνθήκη εικόνας.

Το πλαίσιο Zero123++ προτείνει να χρησιμοποιήσει μια εκπαιδεύσιμη παραλλαγή του μηχανισμού οδηγίας γραμμικής για να ενσωματώσει την παγκόσμια συνθήκη εικόνας στο πλαίσιο με ελάχιστη επιμέρους εκπαίδευση, και τα αποτελέσματα αποδεικνύονται στην ακόλουθη εικόνα. Όπως μπορεί να φανεί, χωρίς την παρουσία μιας παγκόσμιας συνθήκης εικόνας, η ποιότητα του περιεχομένου που παράγεται από το πλαίσιο είναι ικανοποιητική για ορατές περιοχές που αντιστοιχούν στην είσοδο εικόνας. Ωστόσο, η ποιότητα της εικόνας που παράγεται από το πλαίσιο για μη ορατές περιοχές μειώνεται σημαντικά, κυρίως λόγω της αδυναμίας του μοντέλου να συναγάγει την παγκόσμια σεμαντική του αντικειμένου.

Αρχιτεκτονική Μοντέλου

Το πλαίσιο Zero123++ εκπαιδεύεται με το μοντέλο Stable Diffusion 2v-μοντέλο ως βάση χρησιμοποιώντας τις διάφορες προσεγγίσεις και τεχνικές που αναφέρονται στο άρθρο. Το πλαίσιο Zero123++ είναι προεκπαιδευμένο στο σύνολο δεδομένων Objaverse που έχει αποδωθεί με τυχαία HDRI φωτισμό. Το πλαίσιο επίσης υιοθετεί την προσέγγιση φάσεων εκπαίδευσης που χρησιμοποιείται στο πλαίσιο Stable Diffusion Image Variations για να μειώσει περαιτέρω την ποσότητα της επιμέρους εκπαίδευσης που απαιτείται και να διατηρήσει όσο το δυνατόν περισσότερο από το προηγουμένως προεκπαιδευμένο Stable Diffusion.

Η λειτουργία ή αρχιτεκτονική του πλαισίου Zero123++ μπορεί να διαιρεθεί περαιτέρω σε διαδοχικά βήματα ή φάσεις. Η πρώτη φάση μαρτυρά το πλαίσιο να επιμεταλλεύεται τις матρίτσες KV των στρωμάτων διασταυρούμενης προσοχής και τις στρώσεις αυτοπροσοχής του Stable Diffusion με τον AdamW ως βελτιστοποιητή, 1000 βήματα θέρμανσης και το χρονοδιάγραμμα μάθησης κοσίνου που μεγιστοποιεί στο 7×10^-5. Στη δεύτερη φάση, το πλαίσιο χρησιμοποιεί einen πολύ συντηρητικό σταθερό ρυθμό μάθησης με 2000 βήματα θέρμανσης και χρησιμοποιεί την προσέγγιση Min-SNR για να μεγιστοποιήσει την αποδοτικότητα κατά τη διάρκεια της εκπαίδευσης.

Zero123++: Αποτελέσματα και Συγκριτική Απόδοση

Ποιοτική Απόδοση

Για να αξιολογήσει την απόδοση του πλαισίου Zero123++ με βάση την ποιότητα της παραγωγής, συγκρίνεται με τα SyncDreamer και Zero-1-to-3-XL, δύο από τα καλύτερα μοντέλα της τεχνολογίας για την παραγωγή περιεχομένου. Τα πλαισια συγκρίνονται με τέσσερις εικόνες εισόδου με διαφορετικό σκοπό. Η πρώτη εικόνα είναι ένα ηλεκτρικό παιχνίδι γάτα, που λαμβάνεται απευθείας από το σύνολο δεδομένων Objaverse, και διαθέτει μια μεγάλη αβεβαιότητα στο πίσω μέρος του αντικειμένου. Δεύτερη είναι η εικόνα ενός πυροσβεστήρα, και η τρίτη είναι η εικόνα ενός σκύλου που κάθεται σε einen πύραυλο, που παράγεται από το μοντέλο SDXL. Η τελική εικόνα είναι μια εικονογράφηση anime. Τα απαραίτητα βήματα υψόμετρου για τα πλαισια επιτυγχάνονται χρησιμοποιώντας την μέθοδο εκτίμησης υψόμετρου του πλαισίου One-2-3-4-5, και η αφαίρεση φόντου επιτυγχάνεται χρησιμοποιώντας το πλαίσιο SAM. Όπως μπορεί να φανεί, το πλαίσιο Zero123++ παράγει εικόνες πολλαπλών προβολών υψηλής ποιότητας συνεπώς, και είναι ικανό να γενικεύσει σε εξω-τομέα 2D εικονογραφήσεις και AI-παραγόμενα εικόνες εξίσου καλά.

Ποσοτική Ανάλυση

Για να συγκρίνει ποσοτικά το πλαίσιο Zero123++ με τα μοντέλα της τεχνολογίας Zero-1-to-3 και Zero-1-to-3-XL, οι dévelopπεurs αξιολογούν το σκορ Learned Perceptual Image Patch Similarity (LPIPS) των μοντέλων αυτών στο σύνολο δεδομένων επαλήθευσης, ένα υποσύνολο του συνόλου δεδομένων Objaverse. Για να αξιολογήσει την απόδοση του μοντέλου στην παραγωγή πολλαπλών προβολών, οι dévelopπεurs τιλάρουν τις εικόνες αναφοράς και τις 6 παραγόμεнах εικόνες αντίστοιχα, και στη συνέχεια υπολογίζουν το σκορ LPIPS. Τα αποτελέσματα αποδεικνύονται παρακάτω και όπως μπορεί να φανεί, το πλαίσιο Zero123++ επιτυγχάνει την καλύτερη απόδοση στο σύνολο δεδομένων επαλήθευσης.

Αξιολόγηση Κειμένου σε Πολλαπλά Προβολικά

Για να αξιολογήσει την ικανότητα του πλαισίου Zero123++ στην παραγωγή περιεχομένου κειμένου σε πολλαπλά προβολικά, οι dévelopπεurs πρώτα χρησιμοποιούν το μοντέλο SDXL με προrompt κειμένου για να παράγουν μια εικόνα, και στη συνέχεια χρησιμοποιούν το πλαίσιο Zero123++ στην εικόνα που παράγεται. Τα αποτελέσματα αποδεικνύονται στην ακόλουθη εικόνα, και όπως μπορεί να φανεί, όταν συγκρίνεται με το πλαίσιο Zero-1-to-3 που δεν μπορεί να διασφαλίσει συνεπή παραγωγή πολλαπλών προβολών, το πλαίσιο Zero123++ επιστρέφει συνεπή, πραγματικές και υψηλής ποιότητας εικόνες πολλαπλών προβολών εφαρμόζοντας την προσέγγιση κειμένου-σε-εικόνα-σε-πολλαπλά προβολικά ή pipeline.

Zero123++ Depth ControlNet

Επιπλέον του βασικού πλαισίου Zero123++, οι dévelopπεurs έχουν επίσης κυκλοφορήσει το Depth ControlNet Zero123++, μια εκδοχή ελέγχου βάθους του αρχικού πλαισίου που κατασκευάζεται χρησιμοποιώντας την αρχιτεκτονική ControlNet. Οι κανονικοποιημένες γραμμικές εικόνες αποδίδονται σε σχέση με τις επόμενες εικόνες RGB, και ένα πλαίσιο ControlNet εκπαιδεύεται για να ελέγξει τη γεωμετρία του πλαισίου Zero123++ χρησιμοποιώντας την αντίληψη βάθους.

Συμπέρασμα

Σε αυτό το άρθρο, abbiamo μιλήσει για το Zero123++, ένα μοντέλο AI γενετικών μοντέλων που έχει ως στόχο να παράγει 3D-συνεπή πολλαπλά προβολικά εικόνες χρησιμοποιώντας μια seule προβολή εισόδου. Για να μεγιστοποιήσει το πλεονέκτημα που λαμβάνεται από τα προηγουμένως προεκπαιδευμένα γενετικά μοντέλα, το πλαίσιο Zero123++ εφαρμόζει διάφορες τεχνικές εκπαίδευσης και συνθήκων για να ελαχιστοποιήσει την ποσότητα της προσπάθειας που απαιτείται για την επιμέρους εκπαίδευση από τα προκατασκευασμένα μοντέλα διάχυσης εικόνας. Επίσης, abbiamo αναλύσει τις διάφορες προσεγγίσεις και βελτιώσεις που εφαρμόζονται από το πλαίσιο Zero123++ για να επιτύχει αποτελέσματα που είναι συγκρίσιμα με, και ακόμη και να υπερβαίνουν αυτά που επιτύγχαναν τα τρέχοντα μοντέλα της τεχνολογίας.

Ωστόσο, παρά την αποδοτικότητά του και την ικανότητά του να παράγει εικόνες πολλαπλών προβολών υψηλής ποιότητας συνεπώς, το πλαίσιο Zero123++ vẫn έχει κάποιο χώρο για βελτίωση, με πιθανές περιοχές έρευνας να είναι ένα μοντέλο διπλού στάδιου που θα μπορούσε να λύσει την αδυναμία του Zero123++ να ικανοποιήσει παγκόσμιες απαιτήσεις για συνέπεια. Επιπλέον, θα μπορούσε να υπάρξει μια περαιτέρω βελτίωση της ικανότητας του Zero123++ να παράγει εικόνες ακόμη υψηλότερης ποιότητας.

  • Μοντέλο Διπλού Σταδίου που θα μπορούσε να λύσει την αδυναμία του Zero123++ να ικανοποιήσει παγκόσμιες απαιτήσεις για συνέπεια.
  • Επιπλέον Βελτιώσεις για να βελτιώσει περαιτέρω την ικανότητα του Zero123++ να παράγει εικόνες ακόμη υψηλότερης ποιότητας.

Ένας μηχανικός επάγγελμα, ένας συγγραφέας με την καρδιά. Ο Kunal είναι ένας τεχνικός συγγραφέας με einen βαθύ έρωτα και κατανόηση του AI και ML, αφιερωμένος στο να απλοποιεί σύνθετες έννοιες σε αυτά τα πεδία μέσω των ελκυστικών και ενημερωτικών εγγράφων του.