Η γωνία του Anderson
Προς LoRAs που μπορούν να επιβιώσουν από αναβαθμίσεις εκδόσεων μοντέλων

Από την πρόσφατη κάλυψή μου για την αύξηση των ερασιτεχνικών Hunyuan Video LoRAs (μικρά, εκπαιδευμένα αρχεία που μπορούν να ενσωματώσουν προσωπικότητες σε μοντέλα κειμένου-εικόνας και εικόνας-βίντεο με δισεκατομμύρια παραμέτρους), ο αριθμός των σχετικών LoRAs που διατίθενται στην κοινότητα Civit έχει αυξηθεί κατά 185%.

Παρά το γεγονός ότι δεν υπάρχουν ιδιαίτερα εύκολες ή χαμηλής προσπάθειας τρόποι για να δημιουργηθεί ένα Hunyuan Video LoRA, ο κατάλογος διασημοτήτων και θεματικών LoRAs στο Civit αυξάνεται καθημερινά. Πηγή: https://civitai.com/
Η ίδια κοινότητα που αγωνίζεται να μάθει πώς να παράγει αυτές τις «προσθήκες προσωπικότητας» για Hunyuan Video (HV) είναι επίσης ουλερά για την υποσχόμενη κυκλοφορία μιας εικόνας-βίντεο (I2V) λειτουργικότητας στο Hunyuan Video.
Σχετικά με την ανοιχτή πηγή σύνθεσης ανθρώπινων εικόνων, αυτό είναι ένα μεγάλο ζήτημα· σε συνδυασμό με την αύξηση των Hunyuan LoRAs, θα μπορούσε να επιτρέψει στους χρήστες να μετατρέψουν φωτογραφίες ανθρώπων σε βίντεο με τρόπο που δεν διαβρώνει την ταυτότητά τους καθώς αναπτύσσεται το βίντεο – το οποίο είναι目前 η περίπτωση σε όλα τα state-of-the-art γεννήτορες εικόνας-βίντεο, συμπεριλαμβανομένων των Kling, Kaiber και του πολύ διαφημισμένου RunwayML:
Κάντε κλικ για αναπαραγωγή. Một γεννήτρια εικόνας-βίντεο από το state-of-the-art Gen 3 Turbo μοντέλο του RunwayML. Ωστόσο, όπως και με όλα τα παρόμοια και λιγότερα ανταγωνιστικά μοντέλα, δεν μπορεί να διατηρήσει συνεχή ταυτότητα όταν το αντικείμενο στρέφεται μακριά από την κάμερα, και τα διακριτά χαρακτηριστικά της αρχικής εικόνας γίνονται «γενική διάχυση γυναικών». Πηγή: https://app.runwayml.com/
Αναπτυσσόμενο ένα προσαρμοσμένο LoRA για την προσωπικότητα που ενδιαφέρει, θα μπορούσε, σε μια ροή εργασίας HV I2V, να χρησιμοποιήσει μια πραγματική φωτογραφία τους ως σημείο εκκίνησης. Αυτό είναι ένα πολύ καλύτερο «σπέρμα» από το να στείλετε einen τυχαίο αριθμό στο μοντέλο και να συμφωνήσετε με ό,τι σημασιολογικό σενάριο προκύπτει. Στη συνέχεια, θα μπορούσε να χρησιμοποιήσει το LoRA, ή πολλά LoRAs, για να διατηρήσει τη συνεχή ταυτότητα, τα μαλλιά, τα ρούχα και άλλα κρίσιμα σημεία μιας γεννήτριας.
Πιθανώς, η διαθεσιμότητα ενός τέτοιου συνδυασμού θα μπορούσε να αντιπροσωπεύσει одну από τις πιο εποχικές αλλαγές στη γεννήτρια AI από την κυκλοφορία του Stable Diffusion, με τεράστια γεννήτρια δύναμη να παραδίδεται σε ερασιτέχνες ανοιχτής πηγής, χωρίς τον κανονισμό (ή «φύλαξη», αν προτιμάτε) που παρέχεται από τους συντάκτες περιεχομένου στα τρέχοντα δημοφιλή συστήματα γεννήτριας βίντεο.
Καθώς γράφω, το Hunyuan εικόνας-βίντεο είναι ένα αδημοσίευτο «πράγμα» στο αποθετήριο Hunyuan Video GitHub, με την κοινότητα ερασιτεχνών να αναφέρει (ανεκδοτικά) ένα σχόλιο Discord από έναν développer Hunyuan, ο οποίος φαίνεται να δήλωσε ότι η κυκλοφορία αυτής της λειτουργικότητας έχει αναβληθεί για κάποιο χρόνο αργότερα στο Q1 λόγω του μοντέλου «δεν είναι αρκετά ασεβές».

Το επίσημο έλεγχο λίστας κυκλοφορίας χαρακτηριστικών για Hunyuan Video. Πηγή: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan
Ακριβής ή όχι, οι développeurs του αποθετηρίου έχουν παραδώσει σημαντικά στο υπόλοιπο της λίστας Hunyuan, και επομένως το Hunyuan I2V φαίνεται να έρχεται τελικά, είτε με σενσορικό, ασεβές ή με κάποιον τρόπο «ξεκλείδωτο».
Αλλά όπως μπορούμε να δούμε στη λίστα πάνω, η κυκλοφορία I2V είναι εμφανώς ένα ξεχωριστό μοντέλο – το οποίο καθιστά πολύ απίθανο ότι οποιοδήποτε από τα τρέχοντα LoRAs του HV στο Civit και αλλού θα λειτουργήσει με αυτό.
Σε αυτήν (τώρα) προβλέψιμη κατάσταση, τα πλαίσια εκπαίδευσης LoRA όπως Musubi Tuner και OneTrainer θα είναι είτε πίσω είτε επαναφορά σχετικά με την υποστήριξη του νέου μοντέλου. Εν τω μεταξύ, ένας ή δύο από τους πιο τεχνολογικά εξειδικευμένους (και επιχειρηματίες) YouTubers AI θα δώσουν τις λύσεις τους μέσω Patreon μέχρι να πιάσει η σκηνή.
Κούραση Αναβάθμισης
Σχεδόν κανείς δεν αντιμετωπίζει κούραση αναβάθμισης όσο ένας ερασιτέχνης LoRA ή μεταγλώττιση· γιατί ο ταχύς και ανταγωνιστικός ρυθμός αλλαγών στη γεννήτρια AI ενθαρρύνει τα ιδρύματα μοντέλων όπως Stability.ai, Tencent και Black Forest Labs να παράγουν μεγαλύτερα και (μερικές φορές) καλύτερα μοντέλα με τη μέγιστη εφικτή συχνότητα.
Από αυτά τα νέα και βελτιωμένα μοντέλα θα έχουν τουλάχιστον διαφορετικές προκαταλήψεις και βαρίδια, και πιο συχνά θα έχουν διαφορετική κλίμακα και/ή αρχιτεκτονική, αυτό σημαίνει ότι η κοινότητα μεταγλώττισης πρέπει να βγάλει τα datasets τους ξανά και να επαναλάβει τη δύσκολη διαδικασία εκπαίδευσης για το νέο μοντέλο.
Για αυτόν τον λόγο, μια ποικιλία τύπων Stable Diffusion LoRA είναι διαθέσιμη στο Civit:

Η διαδρομή αναβάθμισης, οπτικοποιημένη σε επιλογές φίλτρου αναζήτησης στο civit.ai
Καθώς κανένα από αυτά τα ελαφριά μοντέλα LoRA δεν είναι διαλειτουργικά με υψηλότερες ή χαμηλότερες εκδόσεις μοντέλων, και καθώς πολλά από αυτά έχουν εξαρτήσεις από δημοφιλείς μεγάλης κλίμακας ενώσεις και μεταγλωττίσεις που ακολουθούν παλαιότερο μοντέλο, ένα σημαντικό μέρος της κοινότητας τείνει να παραμείνει σε μια «κληρονομική» έκδοση, με τον ίδιο τρόπο που η πιστότητα των πελατών προς τα Windows XP παρέμεινε χρόνια μετά το επίσημο τέλος της υποστήριξής.
Προσαρμογή στην Αλλαγή
Αυτό το θέμα έρχεται στο μυαλό μου λόγω ενός νέου εγγράφου από την Qualcomm AI Research που ισχυρίζεται ότι έχει αναπτύξει μια μέθοδο με την οποία τα υπάρχοντα LoRAs μπορούν να «αναβαθμισθούν» σε μια νεότερη έκδοση μοντέλου.

Παράδειγμα μετατροπής LoRAs μεταξύ εκδόσεων μοντέλων. Πηγή: https://arxiv.org/pdf/2501.16559
Αυτό δεν σημαίνει ότι η νέα προσέγγιση, με τίτλο LoRA-X, μπορεί να μεταφράσει ελεύθερα μεταξύ όλων των μοντέλων του ίδιου τύπου (π.χ. μοντέλα κειμένου-εικόνας, ή μεγάλα γλωσσικά μοντέλα [LLMs])· αλλά οι συγγραφείς έχουν αποδείξει μια αποτελεσματική μετατροπή ενός LoRA από Stable Diffusion v1.5 > SDXL, και μια μετατροπή ενός LoRA για το κειμενο-βασισμένο μοντέλο TinyLlama 3T στο TinyLlama 2.5T.
Το LoRA-X μεταφέρει παραμέτρους LoRA μεταξύ διαφορετικών βασικών μοντέλων διατηρώντας τον προσαρμοστή μέσα στο υποχώρο του πηγαίου μοντέλου· αλλά μόνο σε μέρη του μοντέλου που είναι επαρκώς παρόμοια μεταξύ εκδόσεων μοντέλων.

Σχέδιο για τον τρόπο που το LoRA-X πηγαίο μοντέλο μεταγλωττίζει έναν προσαρμοστή, ο οποίος στη συνέχεια προσαρμόζεται για να ταιριάζει στο μοντέλο-στόχο.
Ενώ αυτό προσφέρει μια πρακτική λύση για σενάρια όπου η επανεκπαίδευση είναι μη επιθυμητή ή αδύνατη (όπως μια αλλαγή άδειας στις αρχικές δεδομένες εκπαίδευσης), η μέθοδος είναι περιορισμένη σε παρόμοιες αρχιτεκτονικές μοντέλων, μεταξύ άλλων περιορισμών.
Αν και αυτό είναι một σπάνιο βήμα σε ένα υποαπασχολούμενο πεδίο, δεν θα εξετάσουμε αυτό το έγγραφο σε βάθος λόγω των πολλών ελαττωμάτων του LoRA-X, όπως φαίνεται από τα σχόλια των κριτικών και συμβούλων στο Open Review.
Η μέθοδος LoRA-X βασίζεται στην ομοιότητα υποχώρου και περιορίζει την εφαρμογή της σε στενά συναφείς μοντέλα, και οι συγγραφείς έχουν παραδεχθεί στο φόρουμ αναθεώρησης ότι το LoRA-X δεν μπορεί να μεταφερθεί εύκολα μεταξύ σημαντικά διαφορετικών αρχιτεκτονικών
Άλλες Προσεγγίσεις PEFT
Η δυνατότητα να κάνει τα LoRAs πιο μεταφέρσιμα μεταξύ εκδόσεων είναι μια μικρή αλλά ενδιαφέρουσα πτυχή της μελέτης στη βιβλιογραφία, και η κύρια συνεισφορά που το LoRA-X κάνει σε αυτήν την αναζήτηση είναι η άποψη ότι δεν απαιτεί εκπαίδευση. Αυτό δεν είναι αυστηρά αλήθεια, αν διαβάσετε το έγγραφο, αλλά απαιτεί την ελάχιστη εκπαίδευση από όλες τις προηγούμενες μεθόδους.
Το LoRA-X είναι μια άλλη είσοδος στο κανόνα των μεθόδων PEFT, οι οποίες αντιμετωπίζουν την πρόκληση της προσαρμογής μεγάλων προ-εκπαιδευμένων μοντέλων σε συγκεκριμένες εργασίες χωρίς εκτεταμένη επανεκπαίδευση. Αυτή η концептуαλιστική προσέγγιση στοχεύει στην τροποποίηση ενός ελάχιστου αριθμού παραμέτρων ενώ διατηρεί την απόδοση.
Σημαντικά μεταξύ αυτών είναι:
X-Adapter
Το πλαίσιο X-Adapter μεταφέρει μεταγλωττισμένους προσαρμοστές μεταξύ μοντέλων με κάποια επανεκπαίδευση. Το σύστημα στοχεύει να επιτρέψει προ-εκπαιδευμένα modules (όπως ControlNet και LoRA) από ένα βασικό μοντέλο διάχυσης (π.χ. Stable Diffusion v1.5) να λειτουργούν άμεσα με ένα αναβαθμισμένο μοντέλο διάχυσης όπως το SDXL χωρίς επανεκπαίδευση – αποτελώντας αποτελεσματικά ένα «παγκόσμιο αναβαθμιστή» για plugins.
Το σύστημα επιτυγχάνει αυτό εκπαιδεύοντας μια πρόσθετη δικτύωση που ελέγχει το αναβαθμισμένο μοντέλο, χρησιμοποιώντας μια παγωμένη αντίγραφο του βασικού μοντέλου για να διατηρήσει τους συνδεσμούς plugin:

Σχέδιο για X-Adapter. Πηγή: https://arxiv.org/pdf/2312.02238
X-Adapter αρχικά αναπτύχθηκε και δοκιμάστηκε για τη μεταφορά προσαρμοστών από SD1.5 στο SDXL, ενώ το LoRA-X προσφέρει eine większa ποικιλία μετατροπών.
DoRA (Weight-Decomposed Low-Rank Adaptation)
DoRA είναι μια βελτιωμένη μέθοδος μεταγλώττισης που βελτιώνει το LoRA χρησιμοποιώντας μια στρατηγική αποσύνθεσης βαρών που μοιάζει περισσότερο με πλήρη μεταγλώττιση:

DoRA δεν προσπαθεί απλώς να αντιγράψει έναν προσαρμοστή σε ένα παγωμένο περιβάλλον, όπως το LoRA-X, αλλά αντίθετα αλλάζει θεμελιώδεις παραμέτρους των βαρών, όπως η ένταση και η κατεύθυνση. Πηγή: https://arxiv.org/pdf/2402.09353
DoRA εστιάζει στην βελτίωση της διαδικασίας μεταγλώττισης, αποσυνθέτοντας τα βαρίδια του μοντέλου σε ένταση και κατεύθυνση (βλέπε εικόνα παραπάνω). Αντίθετα, το LoRA-X εστιάζει στην ενεργοποίηση της μεταφοράς υφιστάμενων μεταγλωττισμένων παραμέτρων μεταξύ διαφορετικών βασικών μοντέλων
Ωστόσο, η προσέγγιση LoRA-X προσαρμόζει τις πρότζεκτ τεχνικές που αναπτύχθηκαν για DoRA, και σε δοκιμές ενάντια σε αυτό το παλαιότερο σύστημα ισχυρίζεται μια βελτιωμένη DINO βαθμολογία.
FouRA (Fourier Low Rank Adaptation)
Δημοσιευμένο τον Ιούνιο του 2024, η μέθοδος FouRA προέρχεται, όπως και το LoRA-X, από την Qualcomm AI Research, και μοιράζεται κάποια από τα testing prompts και θέματα.

Παραδείγματα κατάρρευσης κατανομής σε LoRA, από το έγγραφο FouRA του 2024, χρησιμοποιώντας το μοντέλο Realistic Vision 3.0 εκπαιδευμένο με LoRA και FouRA για «Blue Fire» και «Origami» style προσαρμοστές, σε τέσσερις σπόρους. Οι εικόνες LoRA παρουσιάζουν κατάρρευση κατανομής και μειωμένη ποικιλία, ενώ το FouRA παράγει πιο ποικιλόμορφες εξόδους. Πηγή: https://arxiv.org/pdf/2406.08798
FouRA εστιάζει στην βελτίωση της ποικιλίας και της ποιότητας των παραγόμενων εικόνων, προσαρμόζοντας το LoRA στο domaine συχνότητας, χρησιμοποιώντας μια Fourier μετασχηματισμό προσέγγιση.
Εδώ, και πάλι, το LoRA-X ήταν σε θέση να επιτύχει καλύτερα αποτελέσματα από την Fourier-βασισμένη προσέγγιση του FouRA.
Αν και και τα δύο πλαίσια ανήκουν στην κατηγορία PEFT, έχουν πολύ διαφορετικές περιπτώσεις χρήσης και προσεγγίσεις· σε αυτήν την περίπτωση, το FouRA είναι ουσιαστικά «γέμισμα» για μια δοκιμαστική στροφή με περιορισμένους ανταγωνιστές για τους συγγραφείς του νέου εγγράφου.
SVDiff
SVDiff έχει επίσης διαφορετικά στόχους από το LoRA-X, αλλά είναι ισχυρά διατυπωμένο στο νέο έγγραφο. SVDiff σχεδιάζεται για να βελτιώσει την αποτελεσματικότητα της μεταγλώττισης των μοντέλων διάχυσης, και τροποποιεί άμεσα τις τιμές μέσα στις πίνακες βαρών του μοντέλου, κρατώντας τους διανυσματικούς διανύσματα αμετάβλητους. SVDiff χρησιμοποιεί κοπείσα SVD, τροποποιώντας μόνο τις μεγαλύτερες τιμές, για να προσαρμόσει τα βαρίδια του μοντέλου.
Αυτή η προσέγγιση χρησιμοποιεί μια τεχνική aumento δεδομένων που ονομάζεται Cut-Mix-Unmix:

Η γεννήτρια πολλαπλών θεμάτων λειτουργεί ως σύστημα απομόνωσης εννοιών στο SVDiff. Πηγή: https://arxiv.org/pdf/2303.11305
Cut-Mix-Unmix σχεδιάζεται για να βοηθήσει το μοντέλο διάχυσης να μάθει πολλαπλά ξεχωριστά εννοιολογικά χωρίς να τα αναμιγνύει. Η κεντρική ιδέα είναι να πάρει εικόνες διαφορετικών αντικειμένων και να τις συνδέσει σε μια seule εικόνα. Στη συνέχεια, το μοντέλο εκπαιδεύεται με προτροπές που περιγράφουν ρητά τα ξεχωριστά στοιχεία της εικόνας. Αυτό αναγκάζει το μοντέλο να αναγνωρίσει και να διατηρήσει ξεχωριστά εννοιολογικά αντί να τα συγχωνεύσει.
Κατά τη διάρκεια της εκπαίδευσης, ένας πρόσθετος όρος κανονικοποίησης βοηθά στην πρόληψη της διείσδυσης μεταξύ θεμάτων. Η θεωρία των συγγραφέων υποστηρίζει ότι αυτό διευκολύνει τη βελτίωση της γεννήτριας πολλαπλών θεμάτων, όπου κάθε στοιχείο παραμένει οπτικά ξεχωριστό, αντί να συγχωνεύεται.
SVDiff, που εξαιρέθηκε από τη δοκιμαστική στροφή του LoRA-X, στοχεύει να δημιουργήσει einen συμπαγή χώρο παραμέτρων. Το LoRA-X, αντίθετα, εστιάζει στην μεταφερσιμότητα των παραμέτρων LoRA μεταξύ διαφορετικών βασικών μοντέλων, λειτουργώντας μέσα στο υποχώρο του αρχικού μοντέλου.
Συμπέρασμα
Οι μεθόδοι που συζητήθηκαν εδώ δεν είναι οι μόνοι κάτοικοι της PEFT. Άλλοι περιλαμβάνουν QLoRA και QA-LoRA· Prefix Tuning· Prompt-Tuning· και adapter-tuning, μεταξύ άλλων.
Το «αναβαθμισμένο LoRA» είναι, ίσως, μια αλχημιστική αναζήτηση· σίγουρα, δεν υπάρχει τίποτα άμεσο στο ορίζοντα που θα εμποδίσει τους μοντελιστές LoRA από το να βγάλουν τα παλιά datasets τους ξανά για την τελευταία και καλύτερη κυκλοφορία βαρών. Αν υπάρχει κάποιο πιθανό προτυπικό πρότυπο για αναθεώρηση βαρών, ικανό να επιβιώσει από αλλαγές αρχιτεκτονικής και φουσκωμένα παράμετρους μεταξύ εκδόσεων μοντέλων, δεν έχει εμφανιστεί στη βιβλιογραφία ακόμη, και θα πρέπει να συνεχίσει να εξάγεται από τα δεδομένα σε κάθε μοντέλο.
Πρώτη δημοσίευση Πέμπτη, 30 Ιανουαρίου 2025












