Η γωνία του Anderson
Επεξεργασία Αντικειμένων με Βοήθεια Τεχνητής Νοημοσύνης με το Imagic της Google και το ‘Erase and Replace’ του Runway

Αυτήν την εβδομάδα, δύο νέοι, αλλά αντιθετικοί αλγόριθμοι γραφικών με τεχνητή νοημοσύνη προσφέρουν καινοτόμους τρόπους για τους τελικούς χρήστες να πραγματοποιούν εξαιρετικά λεπτομερείς και αποτελεσματικές αλλαγές σε αντικείμενα σε φωτογραφίες.
Το πρώτο είναι Imagic, από το Google Research, σε συνεργασία με το Ισραηλινό Ινστιτούτο Τεχνολογίας και το Ινστιτούτο Επιστήμης Weizmann. Το Imagic προσφέρει επεξεργασία αντικειμένων με βάση το κείμενο, λεπτομερή, μέσω της βελτιστοποίησης των μοντέλων διάχυσης.

Change what you like, and leave the rest – Imagic promises granular editing of only the parts that you want to be changed. Source: https://arxiv.org/pdf/2210.09276.pdf
Όποιος έχει προσπαθήσει ποτέ να αλλάξει μόνο ένα στοιχείο σε μια επαναδημιουργία με Stable Diffusion γνωρίζει πολύ καλά ότι για κάθε επιτυχημένη επεξεργασία, το σύστημα αλλάζει πέντε πράγματα που σας άρεσαν ακριβώς όπως ήταν. Πρόκειται για ένα μειονέκτημα που αυτή τη στιγμή κάνει πολλούς από τους πιο ταλαντούχους ενθουσιώδεις του SD να εναλλάσσονται συνεχώς μεταξύ Stable Diffusion και Photoshop, για να διορθώσουν αυτό το είδος «παρενθετικής ζημιάς». Από αυτή τη σκοπιά μόνο, τα επιτεύγματα του Imagic φαίνονται αξιοσημείωτα.
Κατά τη στιγμή της σύνταξης, το Imagic δεν διαθέτει ακόμη ούτε καν ένα προωθητικό βίντεο, και, δεδομένης της συνετής στάσης της Google σχετικά με την κυκλοφορία ανεξέλεγκτων εργαλείων σύνθεσης εικόνας, είναι αβέβαιο σε ποιο βαθμό, αν υπάρχει, θα έχουμε την ευκαιρία να δοκιμάσουμε το σύστημα.
Η δεύτερη προσφορά είναι η πιο προσιτή δυνατότητα Erase and Replace της Runway ML, μια νέα λειτουργία στην ενότητα «AI Magic Tools» της αποκλειστικά διαδικτυακής σουίτας εργαλείων οπτικών εφέ βασισμένων στη μηχανική μάθηση.

Runway ML’s Erase and Replace feature, already seen in a preview for a text-to-video editing system.
Ας ρίξουμε πρώτα μια ματιά στην παρουσίαση της Runway.
Erase and Replace
Όπως το Imagic, το Erase and Replace ασχολείται αποκλειστικά με στατικές εικόνες, αν και η Runway έχει προβάλει την ίδια λειτουργία σε μια λύση επεξεργασίας κειμένου-σε-βίντεο που δεν έχει ακόμη κυκλοφορήσει:

Though anyone can test out the new Erase and Replace on images, the video version is not yet publicly available. Source: https://twitter.com/runwayml/status/1568220303808991232
Αν και η Runway ML δεν έχει δημοσιεύσει λεπτομέρειες για τις τεχνολογίες πίσω από το Erase and Replace, η ταχύτητα με την οποία μπορείτε να αντικαταστήσετε ένα εσωτερικό φυτό με ένα λογικά πειστικό άγαλμα του Ronald Reagan υποδηλώνει ότι ένα μοντέλο διάχυσης όπως το Stable Diffusion (ή, πολύ λιγότερο πιθανό, ένα αδειοδοτημένο DALL‑E 2) είναι η μηχανή που επανεφευρίσκει το αντικείμενο της επιλογής σας στο Erase and Replace.

Replacing a house plant with a bust of The Gipper isn’t quite as fast as this, but it’s pretty fast. Source: https://app.runwayml.com/
Το σύστημα έχει ορισμένους περιορισμούς τύπου DALL‑E 2 – εικόνες ή κείμενα που ενεργοποιούν τα φίλτρα Erase and Replace θα προκαλέσουν μια προειδοποίηση σχετικά με πιθανή αναστολή λογαριασμού σε περίπτωση περαιτέρω παραβάσεων – ουσιαστικά ένα τυπικό αντίγραφο των συνεχιζόμενων πολιτικών της OpenAI για το DALL‑E 2.
Πολλά από τα αποτελέσματα στερούνται των τυπικών αδυναμιών του Stable Diffusion. Η Runway ML είναι επενδυτές και ερευνητικοί συνεργάτες στο SD, και είναι πιθανό να έχουν εκπαιδεύσει ένα ιδιόκτητο μοντέλο που είναι ανώτερο από τα ανοιχτού κώδικα βάρη ελέγχου 1.4 που οι υπόλοιποι μας αντιμετωπίζουμε αυτή τη στιγμή (καθώς πολλές άλλες ομάδες ανάπτυξης, ερασιτέχνες και επαγγελματίες, εκπαιδεύουν ή βελτιστοποιούν μοντέλα Stable Diffusion).

Substituting a domestic table for a ‘table made of ice’ in Runway ML’s Erase and Replace.
Όπως και με το Imagic (δείτε παρακάτω), το Erase and Replace είναι «προσανατολισμένο σε αντικείμενα», κατά κάποιο τρόπο – δεν μπορείτε απλώς να διαγράψετε ένα «κενό» τμήμα της εικόνας και να το γεμίσετε με το αποτέλεσμα της προτροπής κειμένου· σε αυτή την περίπτωση, το σύστημα θα εντοπίσει απλώς το πλησιέστερο εμφανές αντικείμενο κατά μήκος της γραμμής όρασης της μάσκας (όπως ένας τοίχος ή μια τηλεόραση) και θα εφαρμόσει τη μετατροπή εκεί.

As the name indicates, you can’t inject objects into empty space in Erase and Replace. Here, an effort to summon up the most famous of the Sith lords results in a strange Vader-related mural on the TV, roughly where the ‘replace’ area was drawn.
Είναι δύσκολο να διακρίνουμε αν το Erase and Replace αποφεύγει τη χρήση προστατευμένων από πνευματικά δικαιώματα εικόνων (που παραμένουν σε μεγάλο βαθμό περιορισμένες, αν και με μεταβαλλόμενη επιτυχία, στο DALL‑E 2), ή αν το μοντέλο που χρησιμοποιείται στη μηχανή απόδοσης στο παρασκήνιο δεν είναι απλώς βελτιστοποιημένο για τέτοιο είδος.

The slightly NSFW ‘Mural of Nicole Kidman’ indicates that the (presumably) diffusion-based model at hand lacks DALL-E 2’s former systematic rejection of rendering realistic faces or racy content, while the results for attempts to evince copyrighted works range from the ambiguous (‘xenomorph’) to the absurd (‘the iron throne’). Inset bottom right, the source picture.
Θα ήταν ενδιαφέρον να γνωρίζουμε ποιες μέθοδοι χρησιμοποιεί το Erase and Replace για την απομόνωση των αντικειμένων που μπορεί να αντικαταστήσει. Πιθανώς η εικόνα περνάει από κάποια παραλλαγή του CLIP, με τα διακριτά στοιχεία να εντοπίζονται μέσω αναγνώρισης αντικειμένων και επακόλουθης σημασιολογικής τμηματοποίησης. Καμία από αυτές τις λειτουργίες δεν λειτουργεί σχεδόν τόσο καλά σε μια τυπική εγκατάσταση του Stable Diffusion.
Αλλά τίποτα δεν είναι τέλειο – μερικές φορές το σύστημα φαίνεται να διαγράφει χωρίς να αντικαθιστά, ακόμη και όταν (όπως είδαμε στην παραπάνω εικόνα) ο υποκείμενος μηχανισμός απόδοσης γνωρίζει σαφώς τι σημαίνει η προτροπή κειμένου. Σε αυτή την περίπτωση, αποδεικνύεται αδύνατο να μετατρέψετε ένα τραπεζάκι καφέ σε ξενόμορφο – αντίθετα, το τραπέζι απλώς εξαφανίζεται.

A scarier iteration of ‘Where’s Waldo’, as Erase and Replace fails to produce an alien.
Το Erase and Replace φαίνεται να είναι ένα αποτελεσματικό σύστημα αντικατάστασης αντικειμένων, με εξαιρετική επικόλληση. Ωστόσο, δεν μπορεί να επεξεργαστεί υπάρχοντα αντιληπτά αντικείμενα, αλλά μόνο να τα αντικαταστήσει. Η πραγματική τροποποίηση του υπάρχοντος περιεχομένου της εικόνας χωρίς να επηρεαστεί το περιβάλλον υλικό είναι, κατά κάποιον τρόπο, μια πολύ πιο δύσκολη εργασία, συνδεδεμένη με τη μακρά μάχη του τομέα έρευνας υπολογιστικής όρασης για το διαχωρισμό στους διάφορους λανθάνοντες χώρους των δημοφιλών πλαισίων.
Imagic
Αυτή είναι μια εργασία που αντιμετωπίζει το Imagic. Η νέα εργασία προσφέρει πολυάριθμα παραδείγματα επεξεργασιών που διορθώνουν επιτυχώς μεμονωμένες πτυχές μιας φωτογραφίας, αφήνοντας το υπόλοιπο της εικόνας ανέπαφο.

In Imagic, the amended images do not suffer from the characteristic stretching, distortion and ‘occlusion guessing’ characteristic of deepfake puppetry, which utilizes limited priors derived from a single image.
Το σύστημα χρησιμοποιεί μια τριπλή διαδικασία – βελτιστοποίηση ενσωμάτωσης κειμένου· βελτιστοποίηση μοντέλου· και, τέλος, τη δημιουργία της τροποποιημένης εικόνας.

Imagic encodes the target text prompt to retrieve the initial text embedding, and then optimizes the result to obtain the input image. After that, the generative model is fine-tuned to the source image, adding a range of parameters, before being subjected to the requested interpolation.
Δεν είναι έκπληξη που το πλαίσιο βασίζεται στην αρχιτεκτονική κειμένου-σε-βίντεο Imagen της Google, αν και οι ερευνητές δηλώνουν ότι οι αρχές του συστήματος είναι ευρέως εφαρμόσιμες σε μοντέλα λανθάνουσας διάχυσης.
Η Imagen χρησιμοποιεί μια τριεπίπεδη αρχιτεκτονική, αντί για την επταεπίπεδη διάταξη που χρησιμοποιείται στην πιο πρόσφατη εξέλιξη κειμένου-σε-βίντεο της εταιρείας. Τα τρία διαφορετικά τμήματα περιλαμβάνουν ένα γενετικό μοντέλο διάχυσης που λειτουργεί σε ανάλυση 64×64 εικονοστοιχείων· ένα μοντέλο υπερ-ανάλυσης που αυξάνει αυτή την έξοδο σε 256×256 εικονοστοιχεία· και ένα επιπλέον μοντέλο υπερ-ανάλυσης για να φτάσει η έξοδος μέχρι την ανάλυση 1024×1024 εικονοστοιχείων.
Το Imagic επεμβαίνει στο αρχικό στάδιο αυτής της διαδικασίας, βελτιστοποιώντας την ζητούμενη ενσωμάτωση κειμένου στο στάδιο των 64 εικονοστοιχείων με έναν βελτιστοποιητή Adam με σταθερό ρυθμό μάθησης 0,0001.

A master-class in disentanglement: those end-users that have attempted to change something as simple as the color of a rendered object in a diffusion, GAN or NeRF model will know how significant it is that Imagic can perform such transformations without ‘tearing apart’ the consistency of the rest of the image.
Η λεπτομερή βελτιστοποίηση πραγματοποιείται στη βάση του μοντέλου Imagen, για 1500 βήματα ανά είσοδο εικόνας, υπό συνθήκες της αναθεωρημένης ενσωμάτωσης. Ταυτόχρονα, το δευτερεύον στρώμα 64px>256px βελτιστοποιείται παράλληλα στην υπό συνθήκες εικόνα. Οι ερευνητές σημειώνουν ότι μια παρόμοια βελτιστοποίηση για το τελικό στρώμα 256px>1024px έχει «ελάχιστη ή καθόλου επίδραση» στα τελικά αποτελέσματα, και γι’ αυτό δεν την υλοποίησαν.
Η εργασία αναφέρει ότι η διαδικασία βελτιστοποίησης διαρκεί περίπου οκτώ λεπτά για κάθε εικόνα σε δίπλο chip TPUV4. Η τελική απόδοση πραγματοποιείται στον πυρήνα της Imagen υπό το σχήμα δειγματοληψίας DDIM.
Σε ομοιότητα με παρόμοιες διαδικασίες λεπτομερούς βελτιστοποίησης για το DreamBooth της Google, οι προκύπτουσες ενσωματώσεις μπορούν επίσης να χρησιμοποιηθούν για στυλιζάρισμα, καθώς και για φωτορεαλιστικές επεξεργασίες που περιέχουν πληροφορίες από τη μεγαλύτερη υποκείμενη βάση δεδομένων που τροφοδοτεί το Imagen (εφόσον, όπως δείχνει η πρώτη στήλη παρακάτω, οι εικόνες προέλευσης δεν διαθέτουν το απαραίτητο περιεχόμενο για αυτές τις μετασχηματισμούς).

Flexible photoreal movement and edits can be elicited via Imagic, while the derived and disentangled codes obtained in the process can as easily be used for stylized output.
Οι ερευνητές συνέκριναν το Imagic με προηγούμενες εργασίες SDEdit, μια προσέγγιση βασισμένη σε GAN από το 2021, σε συνεργασία μεταξύ του Πανεπιστημίου Stanford και του Carnegie Mellon University· και Text2Live, μια συνεργασία, από τον Απρίλιο 2022, μεταξύ του Ινστιτούτου Επιστήμης Weizmann και της NVIDIA.

A visual comparison between Imagic, SDEdit and Text2Live.
Είναι σαφές ότι οι προηγούμενες προσεγγίσεις αντιμετωπίζουν δυσκολίες, αλλά στη κάτω σειρά, που περιλαμβάνει μια τεράστια αλλαγή στάσης, οι ανταγωνιστές αποτυγχάνουν εντελώς να επανασχεδιάσουν το υλικό πηγής, σε αντίθεση με την αξιοσημείωτη επιτυχία του Imagic.
Οι απαιτήσεις πόρων και ο χρόνος εκπαίδευσης ανά εικόνα του Imagic, αν και σύντομοι σε σύγκριση με τα πρότυπα τέτοιων προσπαθειών, το καθιστούν απίθανο να ενσωματωθεί σε μια τοπική εφαρμογή επεξεργασίας εικόνας σε προσωπικούς υπολογιστές – και δεν είναι σαφές σε ποιο βαθμό η διαδικασία λεπτομερούς βελτιστοποίησης θα μπορούσε να κλιμακωθεί σε επίπεδο καταναλωτή.
Κατ’ αυτή τη στιγμή, το Imagic αποτελεί μια εντυπωσιακή προσφορά που ταιριάζει περισσότερο σε API – ένα περιβάλλον με το οποίο η Google Research, επιφυλακτική ως προς την κριτική για τη διευκόλυνση του deepfaking, μπορεί ενδεχομένως να αισθάνεται πιο άνετα.
Πρώτη δημοσίευση 18 Οκτωβρίου 2022.












