Η γωνία του Anderson

Επαναφορά και Επεξεργασία Ανθρώπινων Εικόνων με AI

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
Montage of examples from supplementary material for the paper 'CompleteMe: Reference-based Human Image Completion' (https://liagm.github.io/CompleteMe/pdf/supp.pdf)

Μια νέα συνεργασία μεταξύ του Πανεπιστημίου της Καλιφόρνιας Merced και της Adobe προσφέρει μια πρόοδο στην κατάσταση της τέχνης στην επίλυση ανθρώπινων εικόνων – την πολύ μελετημένη εργασία της “αποσκόμησης” των κρυφών ή αποκρυμμένων μερών των εικόνων των ανθρώπων, για σκοπούς όπως εικονική δοκιμή, animation και επεξεργασία φωτογραφιών.

Εκτός από την επισκευή των κατεστραμμένων εικόνων ή την αλλαγή τους σύμφωνα με την επιθυμία του χρήστη, τα συστήματα ολοκλήρωσης εικόνων ανθρώπων όπως το CompleteMe μπορούν να επιβάλλουν νέα ρούχα (μέσω μιας συνδεδεμένης εικόνας αναφοράς, όπως στην μεσαία στήλη σε αυτές τις δύο περιπτώσεις) σε υπάρχουσες εικόνες. Αυτά τα παραδείγματα προέρχονται από το εκτεταμένο συμπληρωματικό PDF για το νέο έγγραφο. Πηγή: https://liagm.github.io/CompleteMe/pdf/supp.pdf

Εκτός από την επισκευή των κατεστραμμένων εικόνων ή την αλλαγή τους σύμφωνα με την επιθυμία του χρήστη, τα συστήματα ολοκλήρωσης εικόνων ανθρώπων όπως το CompleteMe μπορούν να επιβάλλουν νέα ρούχα (μέσω μιας συνδεδεμένης εικόνας αναφοράς, όπως στην μεσαία στήλη σε αυτές τις δύο περιπτώσεις) σε υπάρχουσες εικόνες. Αυτά τα παραδείγματα προέρχονται από το εκτεταμένο συμπληρωματικό PDF για το νέο έγγραφο. Πηγή: https://liagm.github.io/CompleteMe/pdf/supp.pdf

Η νέα προσέγγιση, με τίτλο CompleteMe: Reference-based Human Image Completion, χρησιμοποιεί συμπληρωματικές εικόνες εισόδου για να “πropose” στο σύστημα τι περιεχόμενο πρέπει να αντικαταστήσει το κρυφό ή λείπων τμήμα της απεικόνισης του ανθρώπου (και έτσι η εφαρμογή σε πλαίσια δοκιμής μόδας):

Το σύστημα CompleteMe μπορεί να προσαρμόσει το περιεχόμενο αναφοράς στο αποκρυμμένο ή κρυφό μέρος της εικόνας του ανθρώπου.

Το σύστημα CompleteMe μπορεί να προσαρμόσει το περιεχόμενο αναφοράς στο αποκρυμμένο ή κρυφό μέρος της εικόνας του ανθρώπου.

Το νέο σύστημα χρησιμοποιεί μια διπλή U-Net αρχιτεκτονική και ένα Region-Focused Attention (RFA) block που κατευθύνει τους πόρους στην σχετική περιοχή της εικόνας.

Οι ερευνητές προσφέρουν επίσης ένα νέο και απαιτητικό σύστημα αναφοράς για την αξιολόγηση εργασιών ολοκλήρωσης με αναφορά (καθώς το CompleteMe είναι μέρος μιας υπάρχουσας και συνεχιζόμενης ερευνητικής γραμμής στην όραση υπολογιστή, αλλά δεν είχε μέχρι τώρα σχήμα αναφοράς).

Σε δοκιμές, και σε μια καλά κλιμακαρισμένη μελέτη χρηστών, η νέα μέθοδος βγήκε μπροστά σε hầu hết των μετρήσεων, και συνολικά. Σε ορισμένες περιπτώσεις, οι αντίπαλες μεθόδοι ήταν εντελώς απογοητευμένες από την προσέγγιση με αναφορά:

Από το συμπληρωματικό υλικό: η μέθοδος AnyDoor έχει ιδιαίτερη δυσκολία να ερμηνεύσει μια εικόνα αναφοράς.

Από το συμπληρωματικό υλικό: η μέθοδος AnyDoor έχει ιδιαίτερη δυσκολία να ερμηνεύσει μια εικόνα αναφοράς.

Το έγγραφο αναφέρει:

‘Εκτεταμένες πειραματικές δοκιμές στη βάση μας αναφοράς αποδεικνύουν ότι το CompleteMe υπερέχει των μεθόδων της κατάστασης της τέχνης, τόσο με αναφορά όσο και χωρίς, σε ποσοτικά μέτρα, ποιοτικά αποτελέσματα και μελέτες χρηστών.

‘Ιδιαίτερα σε απαιτητικές περιπτώσεις που涉ρούν σύνθετες στάσεις, περίπλοκες μοτίβα ρούχων και διακριτά αξεσουάρ, το μοντέλο μας συνεχώς επιτυγχάνει υψηλότερη οπτική πιστότητα και σεμαντική συνάφεια.’

Λυπάμαι, η παρουσία του έργου στο GitHub δεν περιέχει κώδικα, ούτε υποσχέσεις, και η πρωτοβουλία, η οποία έχει επίσης μια σεμνά σελίδα έργου, φαίνεται να έχει κατευθυνθεί ως eine ιδιωτική αρχιτεκτονική.

Πρόσθετο παράδειγμα της υποκειμενικής απόδοσης του νέου συστήματος σε σχέση με προηγούμενες μεθόδοι. Περισσότερες λεπτομέρειες αργότερα στο άρθρο.

Πρόσθετο παράδειγμα της υποκειμενικής απόδοσης του νέου συστήματος σε σχέση με προηγούμενες μεθόδοι. Περισσότερες λεπτομέρειες αργότερα στο άρθρο.

Μέθοδος

Το πλαίσιο CompleteMe βασίζεται σε μια αναφορά U-Net, η οποία χειρίζεται την ενσωμάτωση του βοηθητικού υλικού στη διαδικασία, και μια συνολική U-Net, η οποία προσφέρει ένα ευρύτερο φάσμα διαδικασιών για την απόκτηση του τελικού αποτελέσματος, όπως φαίνεται στο概念τικό σχήμα παρακάτω:

Το концепτικό σχήμα για το CompleteMe. Πηγή: https://arxiv.org/pdf/2504.20042

Το концепτικό σχήμα για το CompleteMe. Πηγή: https://arxiv.org/pdf/2504.20042

Το σύστημα πρώτα κωδικοποιεί την εικόνα εισόδου με μάσκα σε μια.latent αναπαράσταση. Ταυτόχρονα, η αναφορά U-Net επεξεργάζεται πολλές εικόνες αναφοράς – κάθε μια από τις οποίες δείχνει διαφορετικές περιοχές του σώματος – για να εξαγάγει λεπτομερείς χωρικές χαρακτηριστικά.

Αυτά τα χαρακτηριστικά περνούν через ένα Region-focused Attention block που είναι ενσωματωμένο στη “πλήρη” U-Net, όπου είναι επιλεκτικά μασκαρίσματα χρησιμοποιώντας αντίστοιχες μάσκες περιοχής, εγγυώμενος ότι το μοντέλο προσεγγίζει μόνο τις σχετικές περιοχές στις εικόνες αναφοράς.

Τα μασκαρίσματα χαρακτηριστικά είναι τότε ενσωματωμένα με γлобικά CLIP-παράγμένα σεμαντικά χαρακτηριστικά μέσω αποσυνδεδεμένου cross-attention, επιτρέποντας στο μοντέλο να ανακατασκευάσει λείπων περιεχόμενο με λεπτομέρεια και σεμαντική συνάφεια.

Για να ενισχύσει την πραγματικότητα και τη robustness, η διαδικασία μάσκαρίσματος εισόδου συνδυάζει τυχαίες grid-βασισμένες αποκρύψεις με μάσκες σχήματος ανθρώπινου σώματος, κάθε μια από τις οποίες εφαρμόζεται με ισότιμη πιθανότητα, αυξάνοντας τη сложκότητα των λείπων περιοχών που το μοντέλο πρέπει να ολοκληρώσει.

Για Αναφορά Μόνο

Προηγούμενες μεθόδοι για ολοκλήρωση εικόνων με αναφορά συνήθως βασίζονταν σε σεμαντικού επιπέδου κωδικοποιητές. Έργα αυτού του είδους περιλαμβάνουν το CLIP selbst, και το DINOv2, τα οποία εξάγουν γлобικά χαρακτηριστικά από εικόνες αναφοράς, αλλά συχνά χάνουν τις λεπτομερείς χωρικές λεπτομέρειες που απαιτούνται για ακριβή διατήρηση ταυτότητας.

Από το έγγραφο κυκλοφορίας της παλαιότερης μεθόδου DINOv2, η οποία περιλαμβάνεται σε συγκριτικές δοκιμές στην νέα μελέτη: Οι χρωματισμένες επικαλύψεις δείχνουν τους τρεις πρώτους κύριους συντελεστές από την ανάλυση των κύριων συντελεστών (PCA), που εφαρμόζεται σε τμήματα εικόνων μέσα σε κάθε στήλη, υπογραμμίζοντας πώς το DINOv2 ομαδοποιεί παρόμοια μέρη αντικειμένων μαζί σε διαφορετικές εικόνες. Παρά τις διαφορές στη στάση, το στυλ ή την απόδοση, αντίστοιχες περιοχές (όπως φτερά, άκρα ή τροχούς) είναι συνεχώς αντιστοιχισμένες, εικονοποιώντας την ικανότητα του μοντέλου να μάθει δομή με βάση τα μέρη χωρίς επίβλεψη.

Από το έγγραφο κυκλοφορίας της παλαιότερης μεθόδου DINOv2, η οποία περιλαμβάνεται σε συγκριτικές δοκιμές στην νέα μελέτη: Οι χρωματισμένες επικαλύψεις δείχνουν τους τρεις πρώτους κύριους συντελεστές από την ανάλυση των κύριων συντελεστών (PCA), που εφαρμόζεται σε τμήματα εικόνων μέσα σε κάθε στήλη, υπογραμμίζοντας πώς το DINOv2 ομαδοποιεί παρόμοια μέρη αντικειμένων μαζί σε διαφορετικές εικόνες. Παρά τις διαφορές στη στάση, το στυλ ή την απόδοση, αντίστοιχες περιοχές (όπως φτερά, άκρα ή τροχούς) είναι συνεχώς αντιστοιχισμένες, εικονοποιώντας την ικανότητα του μοντέλου να μάθει δομή με βάση τα μέρη χωρίς επίβλεψη. Πηγή: https://arxiv.org/pdf/2304.07193

Το CompleteMe αντιμετωπίζει αυτό το ζήτημα μέσω ενός εξειδικευμένου Reference U-Net, το οποίο αρχικοποιείται από το Stable Diffusion 1.5, αλλά λειτουργεί χωρίς το βήμα θορύβου διάχυσης*.

Κάθε εικόνα αναφοράς, που καλύπτει διαφορετικές περιοχές του σώματος, κωδικοποιείται σε λεπτομερή.latent χαρακτηριστικά μέσω αυτής της U-Net. Γлобικά σεμαντικά χαρακτηριστικά εξάγονται επίσης ξεχωριστά χρησιμοποιώντας το CLIP, και και τα δύο σύνολα χαρακτηριστικών αποθηκεύονται για αποτελεσματική χρήση κατά τη διάρκεια της ενσωμάτωσης με βάση την προσοχή. Έτσι, το σύστημα μπορεί να προσφέρει πολλές εικόνες αναφοράς με ευελιξία, ενώ διατηρεί λεπτομερείς εμφανίσεις.

Ορχήστρα

Η συνολική U-Net διαχειρίζεται τα τελικά στάδια της διαδικασίας ολοκλήρωσης. Προσαρμοσμένη από την μεθόδο inpainting του Stable Diffusion 1.5, λαμβάνει ως είσοδο την εικόνα πηγή με μάσκα σε μορφή latent, μαζί με λεπτομερή χωρικά χαρακτηριστικά που εξάγονται από τις εικόνες αναφοράς και γлобικά σεμαντικά χαρακτηριστικά που εξάγονται από τον κωδικοποιητή CLIP.

Αυτά τα διάφορα εισαγωγικά συνδυάζονται μέσω του RFA block, το οποίο παίζει κρίσιμο ρόλο στη διεύθυνση της προσοχής του μοντέλου προς τις πιο σχετικές περιοχές του υλικού αναφοράς.

Πριν εισέλθουν στην μηχανισμό προσοχής, τα χαρακτηριστικά αναφοράς μασκαρίζονται ρητά για να αφαιρεθούν οι μη σχετικές περιοχές και στη συνέχεια συνδυάζονται με την.latent αναπαράσταση της εικόνας πηγή, εγγυώμενος ότι η προσοχή κατευθύνεται όσο το δυνατόν πιο ακριβώς.

Για να ενισχύσει αυτήν την ενσωμάτωση, το CompleteMe ενσωματώνει einen αποσυνδεδεμένο μηχανισμό προσοχής που προσαρμόζεται από το IP-Adapter framework:

Το IP-Adapter, μέρος του οποίου ενσωματώνεται στο CompleteMe, είναι ένα από τα πιο επιτυχημένα και συχνά χρησιμοποιούμενα έργα από τα τελευταία τρία ταραχώδη χρόνια ανάπτυξης αρχιτεκτονικών μοντέλων διάχυσης. Πηγή: https://ip-adapter.github.io/

Το IP-Adapter, μέρος του οποίου ενσωματώνεται στο CompleteMe, είναι ένα από τα πιο επιτυχημένα και συχνά χρησιμοποιούμενα έργα από τα τελευταία τρία ταραχώδη χρόνια ανάπτυξης αρχιτεκτονικών μοντέλων διάχυσης. Πηγή: https://ip-adapter.github.io/

Αυτό επιτρέπει στο μοντέλο να επεξεργάζεται χωρικά λεπτομερή οπτικά χαρακτηριστικά και ευρύτερα σεμαντικά περιεχόμενα μέσω ξεχωριστών ροών προσοχής, οι οποίες συνδυάζονται αργότερα, οδηγώντας σε μια συνεκτική ανακατασκευή που, όπως ισχυρίζονται οι συγγραφείς, διατηρεί και την ταυτότητα και τις λεπτομέρειες.

Βελτιστοποίηση

Στην απουσία ενός κατάλληλου συνόλου δεδομένων για ολοκλήρωση ανθρώπινων εικόνων με αναφορά, οι ερευνητές έχουν προτείνει το δικό τους. Το (ανώνυμο) σύνολο δεδομένων κατασκευάστηκε με την επιλογή επιλεγμένων ζευγών εικόνων από το σύνολο δεδομένων WPose που αναπτύχθηκε για το έργο UniHuman της Adobe Research το 2023.

Παραδείγματα στάσεων από το έργο UniHuman της Adobe Research το 2023. Πηγή: https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep

Παραδείγματα στάσεων από το έργο UniHuman της Adobe Research το 2023. Πηγή: https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep

Οι ερευνητές drew χειρόγραφα μάσκες πηγή για να υποδείξουν τις περιοχές ολοκλήρωσης, τελικά αποκτώντας 417 τριπλά ζεύγη εικόνων που αποτελούν μια εικόνα πηγή, μάσκα και εικόνα αναφοράς.

Δύο παραδείγματα ομάδων που προέρχονται αρχικά από το σύνολο δεδομένων WPose και που έχουν επεξεργαστεί εκτενώς από τους ερευνητές του νέου εγγράφου.

Δύο παραδείγματα ομάδων που προέρχονται αρχικά από το σύνολο δεδομένων WPose και που έχουν επεξεργαστεί εκτενώς από τους ερευνητές του νέου εγγράφου.

Οι συγγραφείς χρησιμοποίησαν το LLaVA Large Language Model (LLM) για να δημιουργήσουν κείμενα που περιγράφουν τις εικόνες πηγή.

Μετρικές που χρησιμοποιήθηκαν ήταν πιο εκτενείς από το συνηθισμένο; εκτός από το συνήθεις Peak Signal-to-Noise Ratio (PSNR), Structural Similarity Index (SSIM) και Learned Perceptual Image Patch Similarity (LPIPS, σε αυτή την περίπτωση για την αξιολόγηση των περιοχών με μάσκα), οι ερευνητές χρησιμοποίησαν το DINO για βαθμούς ομοιότητας; DreamSim για την αξιολόγηση των αποτελεσμάτων γεννήτριας; και CLIP.

Δεδομένα και Δοκιμές

Για να δοκιμάσουν το έργο, οι συγγραφείς χρησιμοποίησαν τόσο το προεπιλεγμένο μοντέλο Stable Diffusion V1.5 όσο και το μοντέλο inpainting 1.5. Ο κωδικοποιητής εικόνας του συστήματος χρησιμοποίησε το μοντέλο Vision του CLIP, μαζί με στρώματα προβολής – μικρά νευρωνικά δίκτυα που αναμορφώνουν ή ευθυγραμμίζουν τις εξόδους του CLIP για να ταιριάζουν με τις εσωτερικές διαστάσεις χαρακτηριστικών που χρησιμοποιούνται από το μοντέλο.

Η εκπαίδευση έλαβε χώρα για 30.000 επαναλήψεις σε οκτώ NVIDIA A100 GPUs, υπό την εποπτεία Mean Squared Error (MSE) απώλειας, σε μέγεθος δείγματος 64 και ρυθμό μάθησης 2×10-5. Διαφορετικά στοιχεία απορρίπτονταν τυχαία καθ’ όλη τη διάρκεια της εκπαίδευσης, για να αποφευχθεί η υπερπροσαρμογή του συστήματος στα δεδομένα.

Το σύνολο δεδομένων τροποποιήθηκε από το Parts to Whole dataset, το οποίο βασίζεται στο DeepFashion-MultiModal dataset.

Παραδείγματα από το σύνολο δεδομένων Parts to Whole, που χρησιμοποιήθηκαν στην ανάπτυξη των δεδομένων για το CompleteMe. Πηγή: https://huanngzh.github.io/Parts2Whole/

Παραδείγματα από το σύνολο δεδομένων Parts to Whole, που χρησιμοποιήθηκαν στην ανάπτυξη των δεδομένων για το CompleteMe. Πηγή: https://huanngzh.github.io/Parts2Whole/

Οι συγγραφείς αναφέρουν:

‘Για να ικανοποιήσουμε τις απαιτήσεις μας, ξαναχτίσουμε τα ζεύγη εκπαίδευσης χρησιμοποιώντας εικόνες με αποκρύψεις με πολλαπλές εικόνες αναφοράς που κατέγραψαν διάφορες πτυχές της εμφάνισης του ανθρώπου μαζί με τις σύντομες ετικέτες κειμένου.

‘Κάθε δείγμα στο σύνολο δεδομένων μας περιλαμβάνει έξι τύπους εμφάνισης: ρούχα πάνω, ρούχα κάτω, ρούχα ολόκληρου του σώματος, μαλλιά ή κάλυμμα κεφαλής, πρόσωπο και παπούτσια. Για τη στρατηγική μάσκαρίσματος, εφαρμόζουμε 50% τυχαίο grid μάσκαρίσματος μεταξύ 1 και 30 φορές, ενώ για το υπόλοιπο 50%, χρησιμοποιούμε μια μάσκα σχήματος ανθρώπινου σώματος για να αυξήσουμε τη сложκότητα του μάσκαρίσματος.

‘Μετά τη διαδικασία κατασκευής, αποκτήσαμε 40.000 ζεύγη εικόνων για εκπαίδευση.’

Αντιπαλές προηγούμενες μεθόδοι χωρίς αναφορά που δοκιμάστηκαν ήταν Large occluded human image completion (LOHC) και το μοντέλο inpainting BrushNet; μεθόδοι με αναφορά που δοκιμάστηκαν ήταν Paint-by-Example; AnyDoor; LeftRefill; και MimicBrush.

Οι συγγραφείς ξεκίνησαν με μια ποσοτική σύγκριση στις προαναφερθείσες μετρικές:

Αποτελέσματα της αρχικής ποσοτικής σύγκρισης.

Αποτελέσματα της αρχικής ποσοτικής σύγκρισης.

Σχετικά με την ποσοτική αξιολόγηση, οι συγγραφείς σημειώνουν ότι το CompleteMe επιτυγχάνει τα υψηλότερα σκορ σε hầu hết των μετρήσεων αντίληψης, συμπεριλαμβανομένων CLIP-I, DINO, DreamSim και LPIPS, που προορίζονται να καταγράψουν την σεμαντική ευθυγράμμιση και την πιστότητα εμφάνισης μεταξύ της εξόδου και της εικόνας αναφοράς.

Ωστόσο, το μοντέλο δεν υπερέχει όλων των βασικών μεθόδων σε όλα τα μέτρα. Ιδιαίτερα, το BrushNet σκοράρει υψηλότερα στο CLIP-T, το LeftRefill προηγείται στο SSIM και PSNR, και το MimicBrush υπερέχει ελαφρώς στο CLIP-I.

Ενώ το CompleteMe δείχνει συνεχώς ισχυρά αποτελέσματα συνολικά, οι διαφορές απόδοσης είναι μικρές σε ορισμένες περιπτώσεις, και ορισμένα μέτρα παραμένουν στην ηγεσία των ανταγωνιστικών προηγούμενων μεθόδων. Ίσως όχι αδικαιολόγητα, οι συγγραφείς παρουσιάζουν αυτά τα αποτελέσματα ως απόδειξη της ισορροπημένης δύναμης του CompleteMe σε cả τις δομικές και τις αντίληψης διαστάσεις.

Εικονογραφήσεις για τις ποιοτικές δοκιμές που πραγματοποιήθηκαν για τη μελέτη είναι πολύ πολλές για να αναπαραχθούν εδώ, και αναφερόμαστε τον αναγνώστη όχι μόνο στο αρχικό έγγραφο, αλλά και στο εκτεταμένο συμπληρωματικό PDF, το οποίο περιέχει πολλά επιπλέον ποιοτικά παραδείγματα.

Υπογραμμίζουμε τα κύρια ποιοτικά παραδείγματα που παρουσιάζονται στο κύριο έγγραφο, μαζί με μια επιλογή επιπλέον περιπτώσεων που προέρχονται από το συμπληρωματικό πул εικόνων που εισαγωγής στην αρχή του άρθρου:

Αρχικά ποιοτικά αποτελέσματα που παρουσιάζονται στο κύριο έγγραφο. Παρακαλούμε ανατρέξτε στο αρχικό έγγραφο για καλύτερη ανάλυση.

Αρχικά ποιοτικά αποτελέσματα που παρουσιάζονται στο κύριο έγγραφο. Παρακαλούμε ανατρέξτε στο αρχικό έγγραφο για καλύτερη ανάλυση.

Για τα ποιοτικά αποτελέσματα που παρουσιάζονται παραπάνω, οι συγγραφείς σχολιάζουν:

‘Δεδομένης μιας μασκαρίσματος εισόδου, αυτές οι μη με αναφορά μεθόδοι γεννούν πιθανό περιεχόμενο για τις μασκαρίσματος περιοχές χρησιμοποιώντας εικόνες προτεραιότητας ή κείμενο προτύπους.

‘Ωστόσο, όπως υποδεικνύεται στο κόκκινο κουτί, δεν μπορούν να αναπαράγουν συγκεκριμένα λεπτομέρειες όπως τατουάζ ή μοναδικά μοτίβα ρούχων, καθώς λείπουν εικόνες αναφοράς για να οδηγήσουν την ανακατασκευή της ταυτόσημης πληροφορίας.’

Μια δεύτερη σύγκριση, μέρος της οποίας εμφανίζεται παρακάτω, επικεντρώνεται στις τέσσερις μεθόδοι με αναφορά Paint-by-Example, AnyDoor, LeftRefill και MimicBrush. Εδώ μόνο μια εικόνα αναφοράς και ένα κείμενο πρότυπο παρέχονται.

Ποιοτική σύγκριση με μεθόδοι με αναφορά. Το CompleteMe παράγει πιο ρεαλιστικές ολοκλήρωσης και διατηρεί καλύτερα τις συγκεκριμένες λεπτομέρειες από την εικόνα αναφοράς. Τα κόκκινα κουτιά υπογραμμίζουν περιοχές ιδιαίτερου ενδιαφέροντος.

Ποιοτική σύγκριση με μεθόδοι με αναφορά. Το CompleteMe παράγει πιο ρεαλιστικές ολοκλήρωσης και διατηρεί καλύτερα τις συγκεκριμένες λεπτομέρειες από την εικόνα αναφοράς. Τα κόκκινα κουτιά υπογραμμίζουν περιοχές ιδιαίτερου ενδιαφέροντος.

Οι συγγραφείς αναφέρουν:

‘Δεδομένης μιας μασκαρίσματος εικόνας ανθρώπου και μιας εικόνας αναφοράς, άλλες μεθόδοι μπορούν να γεννήσουν πιθανό περιεχόμενο αλλά συχνά αποτυγχάνουν να διατηρήσουν ακριβώς το контекστικό περιεχόμενο από την εικόνα αναφοράς.

‘Σε ορισμένες περιπτώσεις, γεννούν μη σχετικό περιεχόμενο ή λανθασμένα αντιστοιχίζουν αντίστοιχα μέρη από την εικόνα αναφοράς. Σε αντίθεση, το CompleteMe ολοκληρώνει αποτελεσματικά την μασκαρίσματος περιοχή διατηρώντας ακριβώς την ταυτόσημη πληροφορία και αντιστοιχίζοντας σωστά τα αντίστοιχα μέρη του ανθρώπινου σώματος από την εικόνα αναφοράς.’

Για να αξιολογήσουν πώς καλά τα μοντέλα ευθυγραμμίζονται με την ανθρώπινη αντίληψη, οι συγγραφείς διεξήγαγαν μια μελέτη χρηστών που συμμετείχαν 15 annotators και 2.895 ζεύγη δειγμάτων. Κάθε ζεύγος σύγκρινε την έξοδο του CompleteMe με μία από τις τέσσερις μεθόδοι με αναφορά: Paint-by-Example, AnyDoor, LeftRefill ή MimicBrush.

Οι annotators αξιολόγησαν κάθε αποτέλεσμα με βάση την οπτική ποιότητα της ολοκληρωμένης περιοχής και το βαθμό στον οποίο διατηρούσε χαρακτηριστικά ταυτότητας από την εικόνα αναφοράς – και εδώ, αξιολογώντας συνολικά την ποιότητα και την ταυτότητα, το CompleteMe απέκτησε ένα πιο οριστικό αποτέλεσμα:

Αποτελέσματα της μελέτης χρηστών.

Αποτελέσματα της μελέτης χρηστών.

Συμπέρασμα

Εάν κάτι, τα ποιοτικά αποτελέσματα σε αυτή τη μελέτη υπονομεύονται από τον όγκο τους,既然 close εξέταση δείχνει ότι το νέο σύστημα είναι μια πολύ αποτελεσματική είσοδος σε αυτή τη σχετικά νηχάλη αλλά ζεστά-pursued περιοχή της νευρωνικής επεξεργασίας εικόνων.

Ωστόσο, χρειάζεται λίγη επιπλέον προσοχή και zoom-in στις αρχικές PDF για να εκτιμηθεί πώς καλά το σύστημα προσαρμόζει το υλικό αναφοράς στην αποκρυμμένη περιοχή σε σύγκριση (σε σχεδόν όλες τις περιπτώσεις) με προηγούμενες μεθόδοι.

Σας συνιστούμε να εξετάσετε προσεκτικά τα αρχικά confusingle, αν όχι υπερβολικά, αποτελέσματα που παρουσιάζονται στο συμπληρωματικό υλικό.

Σας συνιστούμε να εξετάσετε προσεκτικά τα αρχικά confusingle, αν όχι υπερβολικά, αποτελέσματα που παρουσιάζονται στο συμπληρωματικό υλικό.

 

* Είναι ενδιαφέρον να σημειωθεί πώς η πλέον παλιά έκδοση V1.5 παραμένει μια αγαπημένη των ερευνητών – частично λόγω legacy like-on-like testing, αλλά επίσης επειδή είναι η λιγότερο λογοκριμένη και πιθανώς η πιο εύκολη εκπαίδευση από όλες τις εκδόσεις του Stable Diffusion, και δεν μοιράζεται την λογοκριτική αναπηδία των FOSS Flux εκδόσεων.

VRAM spec δεν δίνεται – θα ήταν είτε 40GB ή 80GB ανά κάρτα.

Πρώτη δημοσίευση Τρίτη, 29 Απριλίου 2025

Συγγραφέας για μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]