Η γωνία του Anderson
Ο Αγώνας για Μηδενική Προσαρμογή σε Γεννήτριες Ινเทλιτζενς

Εάν θέλετε να τοποθετήσετε τον εαυτό σας σε một δημοφιλές εργαλείο δημιουργίας εικόνων ή βίντεο – αλλά δεν είστε ήδη αρκετά διάσημος για το μοντέλο να σας αναγνωρίσει – θα πρέπει να εκπαιδεύσετε ένα μοντέλο προσαρμογής χαμηλού βαθμού (LoRA) χρησιμοποιώντας μια συλλογή από τις δικές σας φωτογραφίες. Μόλις δημιουργηθεί, αυτό το προσωποποιημένο μοντέλο LoRA επιτρέπει στο γεννήτρια να περιλαμβάνει την ταυτότητά σας σε μελλοντικές εξόδους.
Αυτό ονομάζεται συνήθως προσαρμογή στον τομέα της έρευνας σύνθεσης εικόνων και βίντεο. Πρωτοεμφανίστηκε λίγους μήνες μετά την εμφάνιση της Stable Diffusion το καλοκαίρι του 2022, με το έργο DreamBooth της Google Research, που προσέφερε μοντέλα προσαρμογής υψηλής ικανοποίησης, σε ένα κλειστό σχήμα που σύντομα ανταποκριθηκε από τους ενθουσιώδεις και κυκλοφόρησε στην κοινότητα.
Τα μοντέλα LoRA ακολούθησαν γρήγορα και προσέφεραν ευκολότερη εκπαίδευση και πολύ ελαφρύτερα μεγέθη αρχείων, με ελάχιστη ή καθόλου απώλεια ποιότητας, και γρήγορα κυριάρχησαν στην σκηνή της προσαρμογής για την Stable Diffusion και τους διαδόχους της, αργότερα μοντέλα όπως το Flux, και τώρα νέα γεννήτρια βίντεο όπως το Hunyuan Video και το Wan 2.1.
Επανάληψη και Προσαρμογή
Το πρόβλημα είναι ότι, όπως έχουμε σημειώσει πριν, κάθε φορά που ένα νέο μοντέλο κυκλοφορεί, χρειάζεται μια νέα γενιά μοντέλων LoRA για να εκπαιδευτεί, το οποίο αντιπροσωπεύει σημαντική τριβή για τους παραγωγούς LoRA, οι οποίοι μπορεί να εκπαιδεύσουν μια σειρά από προσωποποιημένα μοντέλα μόνο για να διαπιστώσουν ότι μια ενημέρωση του μοντέλου ή ένα δημοφιλές νέο μοντέλο σημαίνει ότι πρέπει να ξεκινήσουν από την αρχή.
Επομένως, οι προσεγγίσεις μηδενικής προσαρμογής έχουν γίνει một ισχυρό ρεύμα στην βιβλιογραφία τελευταία. Σε αυτή την περίπτωση, αντί να χρειάζεται να δημιουργήσετε μια βάση δεδομένων και να εκπαιδεύσετε το δικό σας υπομοντέλο, απλώς παρέχετε μια ή περισσότερες φωτογραφίες του αντικειμένου που θα ενταχθεί στη γεννήτρια, και το σύστημα ερμηνεύει αυτές τις εισόδους σε μια συνδυασμένη έξοδο.
Κάτω από αυτό το σημείο, εκτός από την ανταλλαγή προσώπων, ένα σύστημα αυτού του είδους (εδώ χρησιμοποιώντας PuLID) μπορεί επίσης να ενσωματώσει τιμές ID σε μεταφορά στυλ:

Παραδείγματα μεταφοράς ταυτότητας προσώπου χρησιμοποιώντας το σύστημα PuLID. Πηγή: https://github.com/ToTheBeginning/PuLID?tab=readme-ov-file
HyperLoRA
Με αυτή την σκέψη, υπάρχει ένα ενδιαφέρον νέο έγγραφο από την ByteDance που προτείνει ένα σύστημα που παράγει πραγματικά κώδικα LoRA κατά την πτήση, το οποίο είναι目前 μοναδικό μεταξύ των λύσεων μηδενικής προσαρμογής:

Στα αριστερά, είσοδοι εικόνων. Δεξιά από αυτά, μια ευέλικτη σειρά εξόδων με βάση τις είσοδοι εικόνων, αποτελώντας αποτελεσματικά deepfakes των ηθοποιών Anthony Hopkins και Anne Hathaway.
Το έγγραφο αναφέρει:
‘Τεχνικές που βασίζονται σε προσαρμογείς όπως ο IP-Adapter παγώνουν τους παραμετρικούς παράγοντες του θεμελιώδους μοντέλου και χρησιμοποιούν μια αρχιτεκτονική προσάρτησης για να ενεργοποιήσουν την ενημέρωση μηδενικής προσαρμογής, αλλά συχνά εμφανίζουν έλλειψη φυσικότητας και αυθεντικότητας, τα οποία δεν πρέπει να αγνοηθούν στα έργα σύνθεσης πορτρέτου.
‘[Εισαγωγή] μιας παραμετρικής μεθόδου προσαρμογής, που ονομάζεται HyperLoRA, η οποία χρησιμοποιεί μια προσαρμοστική αρχιτεκτονική προσάρτησης για να παράγει βαρύτητες LoRA, συνδυάζοντας την υπεροχή της LoRA με την ικανότητα μηδενικής προσαρμογής του σχήματος προσαρμογής.
‘Μέσω της προσεκτικά σχεδιασμένης δομής δικτύου και στρατηγικής εκπαίδευσης, επιτύχαμε μηδενική προσαρμογή προσωποποιημένης γεννήτριας πορτρέτου (υποστηρίζοντας τόσο μονές όσο και πολλές εισόδους εικόνων) με υψηλή φωτορεαλιστικότητα, πιστότητα και επεξεργάσιμη.
Μέθοδος
Η νέα μέθοδος χρησιμοποιεί το μοντέλο λανθάνουσας διάχυσης Stable Diffusion (LDM) SDXL ως θεμελιώδες μοντέλο, αν και οι αρχές φαίνεται να ισχύουν για μοντέλα διάχυσης γενικά (ωστόσο, οι απαιτήσεις εκπαίδευσης – δείτε παρακάτω – μπορεί να κάνουν δύσκολο να εφαρμοστούν σε γεννήτριες βίντεο).
Η διαδικασία εκπαίδευσης για το HyperLoRA χωρίζεται σε τρεις στάδια, το καθένα από τα οποία σχεδιάζεται για να απομονώσει και να διατηρήσει συγκεκριμένες πληροφορίες στα εκμαθούμενα βαρύτητες. Ο σκοπός αυτής της διαδικασίας είναι να αποτρέψει την μόλυνση των χαρακτηριστικών ταυτότητας από ακατάλληλα στοιχεία όπως ενδυμασία ή φόντο,同時 με την επίτευξη ταχείας και σταθερής σύγκλισης.

Σχέδιο για το HyperLoRA. Το μοντέλο χωρίζεται σε ‘Hyper ID-LoRA’ για χαρακτηριστικά ταυτότητας και ‘Hyper Base-LoRA’ για φόντο και ενδυμασία. Αυτή η διάκριση μειώνει τη διαρροή χαρακτηριστικών. Κατά την εκπαίδευση, το SDXL και οι κωδικοποιητές είναι παγωμένα, και μόνο τα HyperLoRA modules ενημερώνονται. Κατά την ενημέρωση, μόνο το ID-LoRA απαιτείται για τη γεννήτρια προσωποποιημένων εικόνων.
Μεταβατική Προσέγγιση
Τα χαρακτηριστικά CLIP βοηθούν το μοντέλο να συγκλίνει γρήγορα, αλλά κινδυνεύουν να υπερπροσαρμοστούν, ενώ οι ενσωματώσεις Antelope είναι πιο σταθερές αλλά πιο αργές στην εκπαίδευση. Επομένως, το σύστημα αρχίζει να βασίζεται περισσότερο στο CLIP και σταδιακά εισάγει Antelope, για να αποφευχθεί η αστάθεια.
Στο τελικό στάδιο, οι στρώσεις προσοχής CLIP παγώνονται完全. Μόνο τα modules προσοχής AntelopeV2 συνεχίζουν την εκπαίδευση, επιτρέποντας στο μοντέλο να βελτιώσει την διατήρηση της ταυτότητας χωρίς να υποβαθμίζει την πιστότητα ή την γενικότητα των προηγουμένως εκμαθούμενων στοιχείων.
Ενώ Ζυγίζετε
Μετά την εξαγωγή των χαρακτηριστικών CLIP ViT και AntelopeV2 από ένα δεδομένο πορτρέτο, τα χαρακτηριστικά που λαμβάνονται περνούν через einen περιλαμβανόμενο δειγματολήπτη (παράγωγο του προαναφερθέντος έργου IP-Adapter) – ένα μετασχηματισμό-βασισμένο module που αντιστοιχίζει τα χαρακτηριστικά σε ένα συμπαγές σύνολο συντελεστών.
Δύο ξεχωιστές δειγματολήπτες χρησιμοποιούνται: ένας για τη γεννήτρια βαρύτητων Base-LoRA (που κωδικοποιούν φόντο και μη-ταυτότητα στοιχεία) και ένας για τα βαρύτητα ID-LoRA (που επικεντρώνονται στην ταυτότητα προσώπου).

Σχέδιο για τη δομή του δικτύου HyperLoRA.
Δεδομένα και Τεστ
Για την εκπαίδευση του HyperLoRA, οι ερευνητές χρησιμοποίησαν ένα υποσύνολο 4,4 εκατομμυρίων εικόνων προσώπων από το LAION-2B dataset (τώρα γνωστό ως η πηγή δεδομένων για τα αρχικά μοντέλα Stable Diffusion του 2022).
Η InsightFace χρησιμοποιήθηκε για να φιλτράρει τα μη-πορτρέτο πρόσωπα και πολλαπλά είδη. Οι εικόνες ανανέωθηκαν με το BLIP-2 σύστημα λεζάνδων.
Σε ότι αφορά την αύξηση δεδομένων, οι εικόνες τυχαία περικομμένες γύρω από το πρόσωπο, αλλά πάντα επικεντρωμένες στην περιοχή του προσώπου.
Οι αντίστοιχες βαθμίδες LoRA έπρεπε να προσαρμοστούν στο διαθέσιμο μνήμη στη διαμόρφωση εκπαίδευσης. Επομένως, η βαθμίδα LoRA για το ID-LoRA ορίστηκε σε 8, και η βαθμίδα για το Base-LoRA σε 4, ενώ χρησιμοποιήθηκε οκταβάθμιση συσσώρευση gradient για να προσομοιώσει μεγαλύτερο μέγεθος δείγματος από ότι ήταν δυνατό στο υλικό.
ComfyUI Τεστ
Οι συγγραφείς δημιούργησαν ροές εργασιών στη πλατφόρμα σύνθεσης ComfyUI για να συγκρίνουν το HyperLoRA με τρεις αντίπαλες μεθόδους: InstantID; τον προαναφερθέντα IP-Adapter, στη μορφή του IP-Adapter-FaceID-Portrait framework; και το προαναφερθέν PuLID. Χρησιμοποιήθηκαν συνεπείς σπόροι, προτροπές και μεθόδους δειγματοληψίας σε όλα τα πλαίσια.
Οι συγγραφείς σημειώνουν ότι οι μεθόδους που βασίζονται σε προσαρμογείς (αντί για LoRA) γενικά απαιτούν χαμηλότερες κλίμακες καθοδήγησης χωρίς ταξινόμηση (CFG), ενώ το LoRA (συμπεριλαμβανομένου του HyperLoRA) είναι πιο ανεκτικό σε αυτό το σημείο.
Μετρήσεις
Για μια βάση πιστότητας, οι συγγραφείς μετρούν την ομοιότητα προσώπου χρησιμοποιώντας κοσμικές αποστάσεις μεταξύ ενσωματώσεων εικόνων CLIP (CLIP-I) και ξεχωριστών ενσωματώσεων ταυτότητας (ID Sim) που εξάγονται μέσω CurricularFace, ένα μοντέλο που δεν χρησιμοποιήθηκε κατά την εκπαίδευση.
Κάθε μέθοδος παράγει τέσσερις υψηλής ανάλυσης πορτρέτα ανά ταυτότητα στο σύνολο δοκιμών, με αποτελέσματα που στη συνέχεια μετρήθηκαν.
Η επεξεργάσιμη διαδικασία αξιολογείται τόσο σε σχέση με τα αποτελέσματα CLIP-I μεταξύ εξόδων με και χωρίς τα μοντέλα ταυτότητας (για να δούμε πόσο η ταυτότητα επηρεάζει την εικόνα); όσο και με την μέτρηση της συμμόρφωσης εικόνας-κειμένου CLIP (CLIP-T) σε δέκα παραλλαγές προτύπων που καλύπτουν στυλ μαλλιών, αξεσουάρ, ενδυμασία, και φόντο.
Συμπέρασμα
Η συνεχής ροή των διάφορων συστημάτων προσαρμογής σε μια einz샷 κατά τις τελευταίες 18 μήνες έχει, μέχρι τώρα, πάρει μια ποιότητα απελπισίας. Πολύ λίγες από τις προσφερόμενες λύσεις έχουν κάνει μια αξιοσημείωτη πρόοδο στο σημείο της τέχνης; και αυτές που έχουν προχωρήσει λίγο έχουν εξωφρενικές απαιτήσεις εκπαίδευσης και/ή εξωφρενικά σύνθετες ή πόρων-εντατικές απαιτήσεις ενημέρωσης.
Ενώ η δική της εκπαιδευτική διαδικασία του HyperLoRA είναι τόσο γκουλ-πνευμονική όσο και πολλές πρόσφατες παρόμοιες συμμετοχές, τουλάχιστον τελειώνεις με ένα μοντέλο που μπορεί να χειριστεί ad hoc προσαρμογή από την κιβωτό.
Από το συμπληρωματικό υλικό του εγγράφου, σημειώνουμε ότι η ταχύτητα ενημέρωσης του HyperLoRA είναι καλύτερη από τον IP-Adapter, αλλά χειρότερη από τις δύο άλλες προηγούμενες μεθόδους – και ότι αυτά τα στοιχεία βασίζονται σε μια NVIDIA V100 GPU, η οποία δεν είναι τυπικό καταναλωτικό υλικό (ωστόσο, νεότερα ‘οικιακά’ NVIDIA GPUs μπορούν να ταιριάζουν ή να υπερβαίνουν αυτό το μέγιστο 32GB της VRAM).

Οι ταχύτητες ενημέρωσης των ανταγωνιστικών μεθόδων, σε χιλιοστά του δευτερολέπτου.
Είναι δίκαιο να πούμε ότι η μηδενική προσαρμογή παραμένει ένα ανεπίλυτο πρόβλημα από πρακτικής άποψης,既然 το HyperLoRA έχει σημαντικές απαιτήσεις υλικού που είναι αντιφατικές με την ικανότητά του να παράγει ένα πραγματικά μακροχρόνιο μοντέλο θεμελίωσης.
* Αντιπροσωπεύοντας είτε 640GB ή 1280GB της VRAM, ανάλογα με το ποιο μοντέλο χρησιμοποιήθηκε (αυτό δεν καθορίζεται)
Κυκλοφόρησε για πρώτη φορά την Δευτέρα, 24 Μαρτίου 2025









![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-400x240.jpg)
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-80x80.jpg)

