Η γωνία του Anderson

Πώς η Stable Diffusion θα μπορούσε να αναπτυχθεί ως προϊόν καταναλωτή

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Ιронικά, η Stable Diffusion, το νέο πλαίσιο σύνθεσης εικόνων AI που έχει κατακτήσει τον κόσμο, δεν είναι ούτε σταθερό ούτε πραγματικά “διασκορπισμένο” – τουλάχιστον, όχι ακόμη.

Η πλήρης σειρά των ικανοτήτων του συστήματος είναι διασκορπισμένη σε μια ποικιλία από ατελείωτες προσφερόμενες υπηρεσίες από μια χούφτα αναπτυξιακών που ανταλλάσσουν τις τελευταίες πληροφορίες και θεωρίες σε διάφορες συζητήσεις στο Discord – και η πλειοψηφία των διαδικασιών εγκατάστασης για τα πακέτα που δημιουργούν ή τροποποιούν είναι πολύ μακριά από το “plug and play”.

Αντίθετα, έχουν την τάση να απαιτούν εγκατάσταση μέσω γραμμής εντολών ή BAT-driven εγκατάσταση μέσω GIT, Conda, Python, Miniconda και άλλων προηγμένων πλαισίων ανάπτυξης – λογισμικά πακέτα που είναι τόσο σπάνια μεταξύ του γενικού κοινού καταναλωτών που η εγκατάσταση τους συχνά σημειώνεται από προγράμματα ανίχνευσης ιών και αντιαπαιτητικών προγραμμάτων ως απόδειξη ενός συμβιβασμένου συστήματος.

Μόνο μια μικρή επιλογή σταδίων στο γκέιτ που η τυπική εγκατάσταση της Stable Diffusion απαιτεί目前. Πολλές από τις διανομές επίσης απαιτούν συγκεκριμένες εκδόσεις του Python, οι οποίες μπορεί να έρχονται σε σύγκρουση με τις υπάρχουσες εκδόσεις που έχουν εγκατασταθεί στο σύστημα του χρήστη - αν και αυτό μπορεί να αποφευχθεί με εγκαταστάσεις που βασίζονται στο Docker και, σε κάποιο βαθμό, με τη χρήση περιβαλλόντων Conda.

Μόνο μια μικρή επιλογή σταδίων στο γκέιτ που η τυπική εγκατάσταση της Stable Diffusion απαιτεί. Πολλές από τις διανομές επίσης απαιτούν συγκεκριμένες εκδόσεις του Python, οι οποίες μπορεί να έρχονται σε σύγκρουση με τις υπάρχουσες εκδόσεις που έχουν εγκατασταθεί στο σύστημα του χρήστη – αν και αυτό μπορεί να αποφευχθεί με εγκαταστάσεις που βασίζονται στο Docker και, σε κάποιο βαθμό, με τη χρήση περιβαλλόντων Conda.

Οι νήματα μηνυμάτων και στις δύο κοινότητες SFW και NSFW της Stable Diffusion είναι πλημμυρισμένα με συμβουλές και τεχνάσματα που σχετίζονται με την χάραξη Python scripts και τυπικές εγκαταστάσεις, για να ενεργοποιήσουν βελτιωμένη λειτουργικότητα, ή για να επιλύσουν συχνά σφάλματα εξάρτησης, και μια σειρά από άλλα ζητήματα.

Αυτό αφήνει τον μέσο καταναλωτή, ενδιαφερόμενο για δημιουργία αξιοθαύμαστων εικόνων από προωθήσεις κειμένου, σχεδόν στο έλεος του αυξανόμενου αριθμού μονεταρισμένων διαδικτυακών διεπαφών API, οι περισσότερες από τις οποίες προσφέρουν ένα ελάχιστο αριθμό δωρεάν γεννήσεων εικόνων πριν απαιτήσουν την αγορά token.

Επιπλέον, σχεδόν όλες αυτές οι διαδικτυακές προσφερόμενες υπηρεσίες αρνούνται να εξοδεύουν περιεχόμενο NSFW (πολλά από τα οποία μπορεί να σχετίζονται με μη πορνογραφικά θέματα γενικού ενδιαφέροντος, όπως ο “πόλεμος”) που διακρίνει τη Stable Diffusion από τις bowdlerized υπηρεσίες της OpenAI’s DALL-E 2.

‘Photoshop για Stable Diffusion’

Γοητευμένοι από τις φανταστικές, προκλητικές ή εξωπραγματικές εικόνες που κατοικούν την ετικέτα #stablediffusion του Twitter καθημερινά, αυτό που περιμένει ο ευρύτερος κόσμος είναι ‘Photoshop για Stable Diffusion’ – μια διαδικτυακή εφαρμογή που ενσωματώνει την καλύτερη και πιο ισχυρή λειτουργικότητα της αρχιτεκτονικής της Stability.ai, καθώς και τις διάφορες έξυπνες καινοτομίες της αναδυόμενης κοινότητας SD, χωρίς πλωτές παραθύρα CLI, ασαφείς και αμετάβλητες διαδικασίες εγκατάστασης και ενημέρωσης, ή λείπουν χαρακτηριστικά.

Αυτό που έχουμε目前, στις περισσότερες ικανές εγκαταστάσεις, είναι μια ποικιλία εύγλωττης ιστοσελίδας που διασχίζεται από ένα αποσυνδεδεμένο παράθυρο εντολών, και του οποίου το URL είναι μια τοπική θύρα:

Παρόμοια με τις εφαρμογές σύνθεσης CLI-driven όπως το FaceSwap, και το BAT-κεντρικό DeepFaceLab, η 'prepack' εγκατάσταση της Stable Diffusion δείχνει τις ρίζες της εντολής, με τη διεπαφή που προσεγγίζεται μέσω μιας τοπικής θύρας (βλέπε πάνω από την εικόνα) που επικοινωνεί με τη λειτουργικότητα της CLI-βασισμένης Stable Diffusion.

Παρόμοια με τις εφαρμογές σύνθεσης CLI-driven όπως το FaceSwap, και το BAT-κεντρικό DeepFaceLab, η ‘prepack’ εγκατάσταση της Stable Diffusion δείχνει τις ρίζες της εντολής, με τη διεπαφή που προσεγγίζεται μέσω μιας τοπικής θύρας (βλέπε πάνω από την εικόνα) που επικοινωνεί με τη λειτουργικότητα της CLI-βασισμένης Stable Diffusion.

Χωρίς αμφιβολία, μια πιο ροή εφαρμογή έρχεται. Ήδη υπάρχουν πολλές εφαρμογές που βασίζονται στο Patreon που μπορούν να κατεβάσουν, όπως GRisk και NMKD (βλέπε εικόνα παρακάτω) – αλλά καμία από αυτές δεν ενσωματώνει ακόμη την πλήρη σειρά χαρακτηριστικών που κάποιες από τις πιο προηγμένες και λιγότερο προσιτές υλοποιήσεις της Stable Diffusion μπορούν να προσφέρουν.

Πρώιμες, εφαρμογές Patreon-βασισμένες της Stable Diffusion, ελαφρώς 'app-ized'. NMKD είναι η πρώτη που ενσωματώνει την έξοδο CLI απευθείας στη διεπαφή GUI.

Πρώιμες, εφαρμογές Patreon-βασισμένες της Stable Diffusion, ελαφρώς ‘app-ized’. NMKD είναι η πρώτη που ενσωματώνει την έξοδο CLI απευθείας στη διεπαφή GUI.

Ας δούμε τι θα μπορούσε να μοιάζει μια πιο γυαλισμένη και ολοκληρωμένη υλοποίηση αυτού του αξιοθαύμαστου ανοιχτού κώδικα – και ποια προκλήματα μπορεί να αντιμετωπίσει.

Νομικές Συζητήσεις για μια Πλήρως Χρηματοδοτούμενη Εμπορική Εφαρμογή Stable Diffusion

Το NSFW Παραγοντικό

Ο κώδικας πηγής της Stable Diffusion έχει κυκλοφορήσει με μια εξαιρετικά ανεκτική άδεια που δεν απαγορεύει εμπορικές επαναυπολογισμοί και παραγόμενα έργα που χτίζονται εκτενώς από τον κώδικα πηγής.

Εκτός από τις προαναφερθείσες και αυξανόμενες αριθμό Patreon-βασισμένων Stable Diffusion κατασκευών, καθώς και τον εκτενή αριθμό εφαρμογών που αναπτύσσονται για Figma, Krita, Photoshop, GIMP, και Blender (μεταξύ άλλων), δεν υπάρχει πρακτικός λόγος για τον οποίο μια καλά χρηματοδοτούμενη οίκο ανάπτυξης λογισμικού δεν θα μπορούσε να αναπτύξει μια πολύ πιο περίπλοκη και ικανή εφαρμογή Stable Diffusion. Από μια αγορά προοπτική, υπάρχει κάθε λόγος να πιστεύουμε ότι πολλές τέτοιες πρωτοβουλίες είναι ήδη καλά υπόweg.

Εδώ, τέτοιες προσπάθειες αντιμετωπίζουν αμέσως το δίλημμα σχετικά με το αν θα επιτρέψουν ή όχι την εγγενή φίλτρο NSFW της Stable Diffusion (ένα τμήμα κώδικα), να απενεργοποιηθεί.

‘Θάψιμο’ του NSFW Switch

Αν και η ανοιχτή άδεια της Stability.ai για την Stable Diffusion περιλαμβάνει μια ευρεία ερμηνεύσιμη λίστα εφαρμογών για τις οποίες δεν μπορεί να χρησιμοποιηθεί (π.χ. πορνογραφικό περιεχόμενο και deepfakes), ο seul τρόπος που ένας προμηθευτής θα μπορούσε να απαγορεύσει αποτελεσματικά τέτοια χρήση θα ήταν να συντάξει το φίλτρο NSFW σε ένα αδιαφανές εκτελέσιμο αντί για einen παράμετρο σε ένα αρχείο Python, ή να επιβάλει μια σύγκριση ελέγχου σε ένα αρχείο Python ή DLL που περιέχει τη διεύθυνση NSFW, ώστε να μην μπορεί να συμβεί η απόδοση εάν οι χρήστες τροποποιήσουν αυτή τη ρύθμιση.

Αυτό θα άφηνε την υποτιθέμενη εφαρμογή ‘ευνουχισμένη’ με τον ίδιο τρόπο που το DALL-E 2 είναι τώρα, μειώνοντας την εμπορική της έλξη. Επίσης, αναπόφευκτα, αποσυναρμολογημένες ‘δοκτορικές’ εκδόσεις αυτών των στοιχείων (είτε αρχικά στοιχεία χρόνου εκτέλεσης Python είτε συνταγμένα αρχεία DLL, όπως χρησιμοποιούνται τώρα στη γραμμή εργαλείων Topaz AI εικόνας) θα εμφανίζονταν πιθανότατα στην κοινότητα torrent/hacking για να ξεμπλοκάρουν τέτοιους περιορισμούς, απλώς αντικαθιστώντας τα εμποδιστικά στοιχεία και αρνούμενα τις απαιτήσεις ελέγχου.

Στο τέλος, ο προμηθευτής μπορεί να επιλέξει απλώς να επαναλάβει την προειδοποίηση της Stability.ai κατά της κακοποίησης που χαρακτηρίζει την πρώτη εκτέλεση πολλών τρεχουσών διανομών της Stable Diffusion.

Ωστόσο, οι μικροί ανοιχτοί開発ικοί που χρησιμοποιούν τώρα καθημερινά αποποίηση ευθυνών με αυτόν τον τρόπο έχουν λίγα να χάσουν σε σύγκριση με μια εταιρεία λογισμικού που έχει επενδύσει σημαντικό χρόνο και χρήμα για να κάνει την Stable Diffusion πλήρως διαθέσιμη – που καλεί σε βαθύτερη σκέψη.

Δικαστική Ευθύνη

Όπως πρόσφατα σημειώσαμε, η βάση δεδομένων LAION-aesthetics, μέρος των 4.2 δισεκατομμυρίων εικόνων στις οποίες η Stable Diffusion εκπαιδεύτηκε, περιέχει πολλές εικόνες διασημοτήτων, επιτρέποντας στους χρήστες να δημιουργήσουν αποτελεσματικά deepfakes, συμπεριλαμβανομένων deepfake πορνογραφίας διασημοτήτων.

Από το πρόσφατο άρθρο μας, τέσσερις φάσεις της Jennifer Connelly κατά τη διάρκεια τεσσάρων δεκαετιών της καριέρας της, που υπονοούνται από την Stable Diffusion.

Από το πρόσφατο άρθρο μας, τέσσερις φάσεις της Jennifer Connelly κατά τη διάρκεια τεσσάρων δεκαετιών της καριέρας της, που υπονοούνται από την Stable Diffusion.

Αυτό είναι ένα ξεχωριστό και πιο αμφιλεγόμενο ζήτημα από τη δημιουργία (συνήθως) νόμιμου ‘αφηρημένου’ πορνογραφικού υλικού, το οποίο δεν απεικονίζει ‘πραγματικά’ άτομα (αν και τέτοιες εικόνες υπονοούνται από πολλαπλά πραγματικά φωτογραφικά στοιχεία στο υλικό εκπαίδευσης).

Επειδή ένας αυξανόμενος αριθμός κρατών και χωρών των ΗΠΑ αναπτύσσουν ή έχουν θεσπίσει νόμους κατά της πορνογραφίας deepfake, η ικανότητα της Stable Diffusion να δημιουργήσει πορνογραφία διασημοτήτων θα μπορούσε να σημαίνει ότι μια εμπορική εφαρμογή που δεν είναι εντελώς λογοκριμένη (δηλ. που μπορεί να δημιουργήσει πορνογραφικό υλικό) θα χρειαζόταν κάποια ικανότητα να φιλτράρει αντιλαμβανόμενες διασημότητες.

Ένας τρόπος θα ήταν να παρέχει μια ενσωματωμένη ‘μαύρη λίστα’ όρων που δεν θα γίνονται δεκτοί σε μια προωθήση χρήστη, που σχετίζονται με ονόματα διασημοτήτων και με φανταστικά πρόσωπα με τα οποία μπορεί να συνδέονται. Προφανώς, τέτοιες ρυθμίσεις θα χρειαζόταν να θεσπισθούν σε περισσότερες γλώσσες από το αγγλικό, поскольку τα αρχικά δεδομένα περιλαμβάνουν άλλες γλώσσες. Μια άλλη προσέγγιση θα μπορούσε να ενσωματώσει συστήματα αναγνώρισης διασημοτήτων όπως αυτά που αναπτύχθηκαν από την Clarifai.

Μожет να είναι απαραίτητο για τους παραγωγούς λογισμικού να ενσωματώσουν τέτοιους τρόπους, ίσως αρχικά απενεργοποιημένους, όπως θα μπορούσε να βοηθήσει στην αποτροπή μιας πλήρως ανεξάρτητης εφαρμογής Stable Diffusion από τη δημιουργία προσώπων διασημοτήτων, εν αναμονή νέων νομοθεσιών που θα μπορούσαν να κάνουν τέτοια λειτουργικότητα παράνομη.

Ξανά, ωστόσο, τέτοια λειτουργικότητα θα μπορούσε αναπόφευκτα να αποσυναρμολογηθεί και να αναστραφεί από ενδιαφερόμενους, ωστόσο, ο παραγωγός λογισμικού θα μπορούσε, σε αυτήν την περίπτωση, να ισχυριστεί ότι αυτό είναι αποτελεσματικά μη εξουσιοδοτημένη βανδαλισμός – όσο η αντίστροφη μηχανική δεν γίνεται υπερβολικά εύκολη.

Χαρακτηριστικά που θα μπορούσαν να περιλαμβάνονται

Η βασική λειτουργικότητα σε οποιαδήποτε διανομή της Stable Diffusion θα αναμενόταν από οποιαδήποτε καλά χρηματοδοτούμενη εμπορική εφαρμογή. Αυτά περιλαμβάνουν τη δυνατότητα να χρησιμοποιούνται προωθήσεις κειμένου για να δημιουργηθούν κατάλληλες εικόνες (text-to-image); τη δυνατότητα να χρησιμοποιούνται σketches ή άλλες εικόνες ως οδηγίες για νέες γεννήτριες εικόνες (image-to-image); τα μέσα να ρυθμίσουν πόσο ‘φανταστική’ η система οδηγείται να είναι; einen τρόπο να ανταλλάξουν χρόνο απόδοσης με ποιότητα; και άλλα ‘βασικά’, όπως προαιρετική αυτόματη αρχειοθέτηση εικόνων/προωθήσεων, και προαιρετική προαιρετική ανέβασμα μέσω RealESRGAN, και τουλάχιστον βασική ‘διόρθωση προσώπου’ με GFPGAN ή CodeFormer.

Αυτό είναι ένα αρκετά ‘βανίλια’ εγκατάσταση. Ας δούμε κάποια από τα πιο προηγμένα χαρακτηριστικά που αναπτύσσονται ή επεκτείνονται, τα οποία θα μπορούσαν να ενσωματωθούν σε μια πλήρη ‘παραδοσιακή’ εφαρμογή Stable Diffusion.

Στοχαστική Παγίδευση

Ακόμη και αν ξαναχρησιμοποιήσετε einen σπόρο από μια προηγούμενη επιτυχημένη απόδοση, είναι τρομερά δύσκολο να κάνετε την Stable Diffusion να επαναλάβει ακριβώς μια μεταμόρφωση εάν οποιοδήποτε μέρος της προωθήσεως ή της πηγαίας εικόνας (ή και των δύο) αλλάξει για μια επόμενη απόδοση.

Αυτό είναι ένα πρόβλημα αν θέλετε να χρησιμοποιήσετε EbSynth για να επιβάλει τις μεταμορφώσεις της Stable Diffusion σε πραγματικό βίντεο με χρονική συνάφεια – αν και η τεχνική μπορεί να είναι πολύ αποτελεσματική για απλές λήψεις κεφαλής και ώμων:

Περιορισμένη κίνηση μπορεί να κάνει το EbSynth ένα αποτελεσματικό μέσο για να μετατρέψει τις μεταμορφώσεις της Stable Diffusion σε πραγματικό βίντεο. Πηγή: https://streamable.com/u0pgzd

Περιορισμένη κίνηση μπορεί να κάνει το EbSynth ένα αποτελεσματικό μέσο για να μετατρέψει τις μεταμορφώσεις της Stable Diffusion σε πραγματικό βίντεο. Πηγή: https://streamable.com/u0pgzd

Το EbSynth λειτουργεί εξαγωγώντας μια μικρή επιλογή ‘τροποποιημένων’ κλειδιών σε ένα βίντεο που έχει αποδωθεί σε μια σειρά αρχείων εικόνων (και τα οποία μπορούν αργότερα να ανασυναρμολογηθούν πίσω σε ένα βίντεο).

Σε αυτό το παράδειγμα από τον ιστότοπο του EbSynth, μια μικρή ποσότητα πλαισίων από ένα βίντεο έχουν ζωγραφιστεί με καλλιτεχνικό τρόπο. Το EbSynth χρησιμοποιεί αυτά τα πλάισια ως οδηγούς στυλ για να τροποποιήσει το ganze βίντεο ώστε να ταιριάζει με το ζωγραφισμένο στυλ. Πηγή: https://www.youtube.com/embed/eghGQtQhY38

Σε αυτό το παράδειγμα από τον ιστότοπο του EbSynth, μια μικρή ποσότητα πλαισίων από ένα βίντεο έχουν ζωγραφιστεί με καλλιτεχνικό τρόπο. Το EbSynth χρησιμοποιεί αυτά τα πλάισια ως οδηγούς στυλ για να τροποποιήσει το ganze βίντεο ώστε να ταιριάζει με το ζωγραφισμένο στυλ. Πηγή: https://www.youtube.com/embed/eghGQtQhY38

Στο παράδειγμα παρακάτω, το οποίο απεικονίζει σχεδόν keine κίνηση από την (πραγματική) ξανθιά γυμναστή στην αριστερή πλευρά, η Stable Diffusion έχει ακόμη δυσκολία να διατηρήσει μια συνεπή εμφάνιση, επειδή τα τρία πλάισια που μετατρέπονται ως ‘κλειδιά’ δεν είναι完全 ίδια, ακόμη και αν μοιράζονται το ίδιο αριθμό σπόρου.

Εδώ, ακόμη και με την ίδια προωθήση και σπόρο σε όλες τις τρεις μεταμορφώσεις, και πολύ λίγες αλλαγές μεταξύ των πηγαίων πλαισίων, οι μυς του σώματος ποικίλλουν σε μέγεθος και σχήμα, αλλά πιο σημαντικά το πρόσωπο είναι ασυνεπές, εμποδίζοντας τη χρονική συνάφεια σε μια πιθανή απόδοση EbSynth.

Εδώ, ακόμη και με την ίδια προωθήση και σπόρο σε όλες τις τρεις μεταμορφώσεις, και πολύ λίγες αλλαγές μεταξύ των πηγαίων πλαισίων, οι μυς του σώματος ποικίλλουν σε μέγεθος και σχήμα, αλλά πιο σημαντικά το πρόσωπο είναι ασυνεπές, εμποδίζοντας τη χρονική συνάφεια σε μια πιθανή απόδοση EbSynth.

Αν και το βίντεο SD/EbSynth παρακάτω είναι πολύ εφευρετικό, όπου τα δάχτυλα του χρήστη γίνονται ένα περπατώντας ζευγάρι παντελονιών και ένα πάπια, η ασυνέπεια των παντελονιών τυπικά το πρόβλημα που η Stable Diffusion έχει στη διατήρηση της συνάφειας μεταξύ των διαφορετικών κλειδιών, ακόμη και όταν τα πηγαία πλάισια είναι παρόμοια μεταξύ τους και ο σπόρος είναι συνεπής.

Τα δάχτυλα ενός ανδρός γίνονται ένα περπατώντας άντρας και ένα πάπια, μέσω της Stable Diffusion και του EbSynth. Πηγή: https://old.reddit.com/r/StableDiffusion/comments/x92itm/proof_of_concept_using_img2img_ebsynth_to_animate/

Τα δάχτυλα ενός ανδρός γίνονται ένα περπατώντας άντρας και ένα πάπια, μέσω της Stable Diffusion και του EbSynth. Πηγή: https://old.reddit.com/r/StableDiffusion/comments/x92itm/proof_of_concept_using_img2img_ebsynth_to_animate/

Ο χρήστης που δημιούργησε αυτό το βίντεο σχολίασε ότι η μεταμόρφωση του παπιά, που είναι πιθανότατα η πιο αποτελεσματική από τις δύο, απαιτούσε μόνο ένα μεταμορφωμένο κλειδί, ενώ ήταν απαραίτητο να αποδώσει 50 εικόνες της Stable Diffusion για να δημιουργήσει τα παντελόνια, τα οποία εμφανίζουν περισσότερη χρονική ασυνέπεια. Ο χρήστης σημείωσε επίσης ότι χρειάστηκαν πέντε προσπάθειες για να επιτύχουν συνάφεια για κάθε ένα από τα 50 κλειδιά.

Επομένως, θα ήταν ένα μεγάλο πλεονέκτημα για μια πραγματικά ολοκληρωμένη εφαρμογή της Stable Diffusion να παρέχει λειτουργικότητα που διατηρεί χαρακτηριστικά στο μέγιστο βαθμό μεταξύ των κλειδιών.

Μια Möglichkeit είναι για την εφαρμογή να επιτρέψει στον χρήστη να ‘παγώσει’ τον στοχαστικό κώδικα για τη μεταμόρφωση σε κάθε πλάισιο, το οποίο μπορεί να επιτευχθεί μόνο με τη τροποποίηση του κώδικα χειροκίνητα. Όπως το παράδειγμα παρακάτω δείχνει, αυτό βοηθά τη χρονική συνάφεια, αν και δεν την giải quyếtει απόλυτα:

Ένας χρήστης του Reddit μετέτρεψε βίντεο από μια webcam του σε διάφορους διάσημους ανθρώπους, όχι μόνο διατηρώντας τον σπόρο (που οποιαδήποτε υλοποίηση της Stable Diffusion μπορεί να κάνει), αλλά επίσης διατηρώντας τον στοχαστικό κώδικα() παραμέτρο σε κάθε μεταμόρφωση. Αυτό επιτεύχθηκε με τη τροποποίηση του κώδικα, αλλά θα μπορούσε εύκολα να γίνει μια διαθέσιμη επιλογή χρήστη. Φυσικά, ωστόσο, δεν giải quyếtει όλα τα χρονικά ζητήματα. Πηγή: https://old.reddit.com/r/StableDiffusion/comments/wyeoqq/turning_img2img_into_vid2vid/

Ένας χρήστης του Reddit μετέτρεψε βίντεο από μια webcam του σε διάφορους διάσημους ανθρώπους, όχι μόνο διατηρώντας τον σπόρο (που οποιαδήποτε υλοποίηση της Stable Diffusion μπορεί να κάνει), αλλά επίσης διατηρώντας τον στοχαστικό κώδικα() παραμέτρο σε κάθε μεταμόρφωση. Αυτό επιτεύχθηκε με τη τροποποίηση του κώδικα, αλλά θα μπορούσε εύκολα να γίνει μια διαθέσιμη επιλογή χρήστη. Φυσικά, ωστόσο, δεν giải quyếtει όλα τα χρονικά ζητήματα. Πηγή: https://old.reddit.com/r/StableDiffusion/comments/wyeoqq/turning_img2img_into_vid2vid/

Βασισμένη στο Cloud Textual Inversion

Μια καλύτερη λύση για την εlicit temporally συνεπή χαρακτήρες και αντικείμενα είναι να ‘ψήσουν’ τους σε eine Textual Inversion – ένα αρχείο 5KB που μπορεί να εκπαιδευτεί σε λίγες ώρες με βάση μόνο πέντε αναノημένες εικόνες, το οποίο μπορεί να κληθεί από eine đặc biệt ‘*’ προωθήση, επιτρέποντας, για παράδειγμα, μια συνεπή εμφάνιση νέων χαρακτήρων για ένταξη σε μια αφήγηση.

Εικόνες που συνδέονται με κατάλληλους tags μπορούν να μετατραπούν σε διακριτά οντότητες μέσω Textual Inversion, και να κληθούν χωρίς αμφιβολία, και στο σωστό контекστ και στυλ, από ειδικές token λέξεις. Πηγή: https://huggingface.co/docs/diffusers/training/text_inversion

Εικόνες που συνδέονται με κατάλληλους tags μπορούν να μετατραπούν σε διακριτά οντότητες μέσω Textual Inversion, και να κληθούν χωρίς αμφιβολία, και στο σωστό контεκστ και στυλ, από ειδικές token λέξεις. Πηγή: https://huggingface.co/docs/diffusers/training/text_inversion

Textual Inversions είναι συμπληρωματικά αρχεία στο πολύ μεγάλο και πλήρως εκπαιδευμένο μοντέλο που χρησιμοποιεί η Stable Diffusion, και είναι αποτελεσματικά ‘slipstreamed’ στο proceso προώθησης/κλήσης, ώστε να μπορούν να συμμετέχουν σε σκηνές που προέρχονται από το μοντέλο, και να επωφεληθούν από την τεράστια βάση δεδομένων γνώσεων του μοντέλου για αντικείμενα, στυλ, περιβάλλοντα και αλληλεπιδράσεις.

Ωστόσο, αν και μια Textual Inversion δεν χρειάζεται πολύ χρόνο για να εκπαιδευτεί, απαιτεί μεγάλη ποσότητα VRAM; σύμφωνα με διάφορες τρέχουσες οδηγίες, κάπου μεταξύ 12, 20 και ακόμη και 40GB.

Επειδή οι περισσότεροι καθημερινοί χρήστες είναι απίθανο να έχουν τέτοια GPU δύναμη στη διάθεσή τους, υπηρεσίες cloud αρχίζουν να εμφανίζονται που θα χειριστούν την λειτουργία, συμπεριλαμβανομένης μιας έκδοσης Hugging Face. Αν και υπάρχουν υλοποιήσεις Google Colab που μπορούν να δημιουργήσουν textual inversions για την Stable Diffusion, οι απαιτήσεις VRAM και χρόνου μπορεί να κάνουν αυτά τα ζητήματα προκλητικά για χρήστες Colab.

Για μια πιθανή πλήρη και καλά επενδυμένη εφαρμογή Stable Diffusion (εγκατεστημένη), η διέλευση αυτής της βαρέως εργασίας μέσω των cloud servers της εταιρείας φαίνεται μια προφανής στρατηγική μονεταρίσματος (υποθέτοντας ότι μια δωρεάν εφαρμογή Stable Diffusion είναι διεισδύει με τέτοιου είδους μη δωρεάν λειτουργικότητα, που φαίνεται πιθανό σε πολλές εφαρμογές που θα εμφανιστούν από αυτήν την τεχνολογία τα επόμενα 6-9 μήνες).

Επιπλέον, η σχετικά περίπλοκη διαδικασία της αναノησης και της μορφοποίησης των υποβεβλημένων εικόνων και κειμένου θα μπορούσε να ωφεληθεί από αυτοματοποίηση σε ένα ολοκληρωμένο περιβάλλον. Η потенτική ‘εθιστική’ παράγοντας της δημιουργίας μοναδικών στοιχείων που μπορούν να εξερευνήσουν και να αλληλεπιδράσουν με τους τεράστιους κόσμους της Stable Diffusion θα φαινόταν πιθανότατα επιβεβλημένος, τόσο για γενικούς ενθουσιώδεις όσο και για νεότερους χρήστες.

Ευέλικτη Βάρος Προώθησης

Υπάρχουν πολλές τρέχουσες υλοποιήσεις που επιτρέπουν στον χρήστη να αναθέσει μεγαλύτερη έμφαση σε ένα τμήμα μιας μακράς προώθησης κειμένου, αλλά η οργάνωση ποικίλλει πολύ μεταξύ αυτών, και είναι συχνά ακατάλληλη ή ακατάλληλη.

Η πολύ δημοφιλής διακλάδωση της Stable Diffusion από τον AUTOMATIC1111, για παράδειγμα, μπορεί να μειώσει ή να αυξήσει την τιμή μιας προώθησης λέξης με την περικύκλωση της με μονές ή πολλές αγκύλες (για αποσύνδεση) ή τετράγωνες αγκύλες για πρόσθετη έμφαση.

Τετραγωνικές αγκύλες και/ή παρενθέσεις μπορούν να μετατρέψουν το πρωινό σας σε αυτήν την έκδοση των βαρών προώθησης της Stable Diffusion, αλλά είναι μια νυχτερινή εφιάλτης σε κάθε περίπτωση.

Τετραγωνικές αγκύλες και/ή παρενθέσεις μπορούν να μετατρέψουν το πρωινό σας σε αυτήν την έκδοση των βαρών προώθησης της Stable Diffusion, αλλά είναι μια νυχτερινή εφιάλτης σε κάθε περίπτωση.

Άλλες επαναλήψεις της Stable Diffusion χρησιμοποιούν σημεία για έμφαση, ενώ οι πιο ευέλικτες επιτρέπουν στους χρήστες να αναθέσουν βάρη σε κάθε λέξη της προώθησης μέσω της διεπαφής GUI.

Το σύστημα θα πρέπει επίσης να επιτρέψει αρνητικά βάρη προώθησης – όχι μόνο για φανταστικούς οπαδούς, αλλά επειδή μπορεί να υπάρχουν λιγότερο προβληματικές και πιο διδακτικές μυστήρια στη συνάφεια της Stable Diffusion από ό,τι η περιορισμένη χρήση της γλώσσας μας μπορεί να κάνει.

Εξωτερική Ζωγραφική

Λίγο μετά την ανοιχτή πηγή της Stable Diffusion, η OpenAI προσπάθησε – σε μεγάλο βαθμό χωρίς επιτυχία – να ανακτήσει κάποιο από το θόρυβο του DALL-E 2 ανακοινώνοντας ‘εξωτερική ζωγραφική’, η οποία επιτρέπει στον χρήστη να επεκτείνει μια εικόνα πέρα από τα όριά της με σεμάντική λογική και οπτική συνάφεια.

Φυσικά, αυτό έχει εφαρμοστεί πλέον σε διάφορες μορφές για την Stable Diffusion, καθώς και στο Krita, και θα πρέπει να περιλαμβάνεται σε μια πλήρη, ‘Photoshop-στιλ’ έκδοση της Stable Diffusion.

Τιμίδια-βασισμένη επέκταση μπορεί να επεκτείνει μια τυπική 512x512 απόδοση σχεδόν απεριόριστα, εφόσον οι προωθήσεις, η υπάρχουσα εικόνα και η σεμάντική λογική το επιτρέπουν. Πηγή: https://github.com/lkwq007/stablediffusion-infinity

Τιμίδια-βασισμένη επέκταση μπορεί να επεκτείνει μια τυπική 512×512 απόδοση σχεδόν απεριόριστα, εφόσον οι προωθήσεις, η υπάρχουσα εικόνα και η σεμάντική λογική το επιτρέπουν. Πηγή: https://github.com/lkwq007/stablediffusion-infinity

Επειδή η Stable Diffusion εκπαιδεύτηκε σε 512x512px εικόνες (και για eine σειρά άλλων λόγων), συχνά κόβει τα κεφάλια (ή άλλα essencial σώματα) των ανθρώπων, ακόμη και όπου η προώθηση καθαρώς δήλωνε ‘έμφαση κεφαλής’, κ.λπ..

Τυπικά παραδείγματα 'αποκεφαλισμού' της Stable Diffusion; αλλά η εξωτερική ζωγραφική θα μπορούσε να βάλει τον George πίσω στην εικόνα.

Τυπικά παραδείγματα ‘αποκεφαλισμού’ της Stable Diffusion; αλλά η εξωτερική ζωγραφική θα μπορούσε να βάλει τον George πίσω στην εικόνα.

Οποιαδήποτε υλοποίηση της εξωτερικής ζωγραφικής του τύπου που απεικονίζεται στην κινούμενη εικόνα παραπάνω (η οποία βασίζεται αποκλειστικά σε βιβλιοθήκες Unix, αλλά θα πρέπει να είναι ικανή να αναπαραχθεί σε Windows) θα πρέπει επίσης να είναι tooled ως eine-κλικ/προώθηση λύση για αυτό το πρόβλημα.

Τώρα, πολλά χρήστες επεκτείνουν το καμβά των ‘αποκεφαλισμένων’ απεικονίσεων προς τα πάνω, γυαλίζουν το χώρο του κεφαλιού και χρησιμοποιούν img2img για να ολοκληρώσουν την ελαττωματική απόδοση.

Εфективική Μάσκα που Καταλαβαίνει το Κонтέκστ

Η μάσκα μπορεί να είναι ένα πολύ hit-and-miss affair στην Stable Diffusion, ανάλογα με τη διακλάδωση ή την έκδοση που αναφέρεται. Συχνά, όπου είναι δυνατό να σχεδιαστεί eine συνοχή μάσκας, η καθορισμένη περιοχή τελικά ζωγραφίζεται με περιεχόμενο που δεν λαμβάνει υπόψη τον整 ent контέκστ της εικόνας.

Σε μια περίπτωση, masked out τα κόρνια μιας εικόνας προσώπου, και παρείχα την προώθηση ‘γαλάζια μάτια’ ως μια μάσκα inpaint – μόνο για να ανακαλύψω ότι φαινόμουν να κοιτάζω μέσα από δύο κομμένα ανθρώπινα μάτια σε μια μακρινή εικόνα ενός αλλόκοτου λύκου. Νομίζω ότι είμαι τυχερός που δεν ήταν ο Φρανκ Σινάτρα.

Η σεμάντική επεξεργασία είναι επίσης δυνατή με ταυτοποίηση του θορύβου που κατασκεύασε την εικόνα στην αρχή, το οποίο επιτρέπει στον χρήστη να διευθύνει συγκεκριμένα δομικά στοιχεία σε μια απόδοση χωρίς να παρεμβαίνει με το υπόλοιπο της εικόνας:

Αλλαγή ενός στοιχείου σε μια εικόνα χωρίς παραδοσιακή μάσκα και χωρίς αλλοίωση γειτονικών περιεχομένων, με την ταυτοποίηση του θορύβου που πρώτα προέκυψε την εικόνα και την διεύθυνση των μερών του που συνεισέφεραν στο στόχο περιοχή. Πηγή: https://old.reddit.com/r/StableDiffusion/comments/xboy90/a_better_way_of_doing_img2img_by_finding_the/

Αλλαγή ενός στοιχείου σε μια εικόνα χωρίς παραδοσιακή μάσκα και χωρίς αλλοίωση γειτονικών περιεχομένων, με την ταυτοποίηση του θορύβου που πρώτα προέκυψε την εικόνα και την διεύθυνση των μερών του που συνεισέφεραν στο στόχο περιοχή. Πηγή: https://old.reddit.com/r/StableDiffusion/comments/xboy90/a_better_way_of_doing_img2img_by_finding_the/

Αυτό το μέθοδος βασίζεται στο K-Diffusion sampler.

Σεμάντικες Φίλτρα για Φυσιολογικές Ανωμαλίες

Όπως έχουμε αναφέρει προηγουμένως, η Stable Diffusion μπορεί συχνά να προσθέσει ή να αφαιρέσει άκρα, κυρίως λόγω προβλημάτων δεδομένων και ελαττωμάτων στις αναノησεις που συνοδεύουν τις εικόνες που την εκπαίδευσαν.

Όπως το παραπάνω παιδί που έβγαλε τη γλώσσα του στη σχολική φωτογραφία, οι βιολογικές αταξίες της Stable Diffusion δεν είναι πάντα αμέσως εμφανείς, και μπορεί να έχετε ανεβάσει την τελευταία σας AI-δημιουργημένη μαστίγιο στο Instagram πριν να συνειδητοποιήσετε τα πρόσθετα χέρια ή τα λιώσαμε άκρα.

Όπως το παραπάνω παιδί που έβγαλε τη γλώσσα του στη σχολική φωτογραφία, οι βιολογικές αταξίες της Stable Diffusion δεν είναι πάντα αμέσως εμφανείς, και μπορεί να έχετε ανεβάσει την τελευταία σας AI-δημιουργημένη μαστίγιο στο Instagram πριν να συνειδητοποιήσετε τα πρόσθετα χέρια ή τα λιώσαμε άκρα.

Είναι τόσο δύσκολο να διορθώσετε αυτά τα είδη σφαλμάτων που θα ήταν χρήσιμο αν μια πλήρη εφαρμογή της Stable Diffusion περιείχε κάποιο είδος αναγνώρισης ανατομίας που χρησιμοποιούσε σεμάντική διαχωριστική για να υπολογίσει εάν η εισερχόμενη εικόνα έχει σοβαρές ανατομικές ελαττωματικότητες (όπως στην εικόνα παραπάνω), και την απορρίπτει υπέρ μιας νέας απόδοσης πριν την παρουσιάσει στον χρήστη.

Βέβαια, μπορεί να θέλετε να αποδώσετε τη θεά Kali, ή τον Δρ. Οκ, ή ακόμη και να σώσετε ένα ανεπηρέαστο τμήμα μιας εικόνας με άκρα, οπότε αυτό το χαρακτηριστικό θα πρέπει να είναι eine προαιρετική toggle.

Εάν οι χρήστες θα μπορούσαν να ανεχθούν το τηλεμετρικό аспέκτ, τέτοιες αποτυχίες θα μπορούσαν ακόμη και να μεταφερθούν ανώνυμα σε μια συλλογική προσπάθεια ομοσπονδιακής μάθησης που μπορεί να βοηθήσει μελλοντικά μοντέλα να βελτιώσουν την κατανόηση της ανατομικής λογικής.

LAION-Βασισμένη Αυτόματη Βελτίωση Προσώπου

Όπως σημείωσα στην προηγούμενη ματιά μου στα τρία πράγματα που η Stable Diffusion θα μπορούσε να αντιμετωπίσει στο μέλλον, δεν θα πρέπει να αφήνεται μόνο σε οποιαδήποτε έκδοση του GFPGAN να προσπαθήσει να ‘βελτιώσει’ απόδοσης προσώπου σε πρώτο-INSTANCE απόδοσης.

Οι ‘βελτιώσεις’ του GFPGAN είναι τρομερά γενικές, συχνά υπονομεύουν την ταυτότητα του ατόμου που απεικονίζεται, και λειτουργούν αποκλειστικά σε ένα πρόσωπο που έχει λάβει keine περισσότερη επεξεργασία χρόνου ή προσοχής από οποιοδήποτε άλλο μέρος της εικόνας.

Επομένως, μια επαγγελματική-τυπική εφαρμογή για την Stable Diffusion θα πρέπει να είναι σε θέση να αναγνωρίσει ένα πρόσωπο (με μια τυπική και σχετικά ελαφριά βιβλιοθήκη όπως YOLO), να εφαρμόσει το πλήρες βάρος της διαθέσιμης GPU δύναμης για την επανα-απόδοση του, και είτε να συνδυάσει το βελτιωμένο πρόσωπο στην αρχική πλήρη-κонтέκστ απόδοση, ή να το αποθηκεύσει ξεχωριστά για χειροκίνητη ανασύνθεση. Τώρα, αυτό είναι μια αρκετά ‘χειροκίνητη’ λειτουργία.

Σε περιπτώσεις όπου η Stable Diffusion έχει εκπαιδευτεί σε έναν επαρκή αριθμό εικόνων μιας διασημότητας, είναι δυνατό να εστιάσει την ολόκληρη GPU ικανότητα σε μια επόμενη απόδοση αποκλειστικά του προσώπου της απόδοσης εικόνας, το οποίο είναι συνήθως μια αξιοσημείωτη βελτίωση - και, αντίθετα με το GFPGAN, βασίζεται σε πληροφορίες από LAION-εκπαιδευμένα δεδομένα,而 όχι απλώς ρυθμίζοντας τα απόδοσης pixels.

Σε περιπτώσεις όπου η Stable Diffusion έχει εκπαιδευτεί σε έναν επαρκή αριθμό εικόνων μιας διασημότητας, είναι δυνατό να εστιάσει την ολόκληρη GPU ικανότητα σε μια επόμενη απόδοση αποκλειστικά του προσώπου της απόδοσης εικόνας, το οποίο είναι συνήθως μια αξιοσημείωτη βελτίωση – και, αντίθετα με το GFPGAN, βασίζεται σε πληροφορίες από LAION-εκπαιδευμένα δεδομένα,while όχι απλώς ρυθμίζοντας τα απόδοσης pixels.

Εσωτερικές Αναζητήσεις LAION

Από τότε που οι χρήστες άρχισαν να συνειδητοποιούν ότι η αναζήτηση της βάσης δεδομένων LAION για έννοιες, άτομα και θέματα θα μπορούσε να βοηθήσει στη βελτίωση της χρήσης της Stable Diffusion, έχουν δημιουργηθεί διάφορα διαδικτυακά LAION εξερευνητές, συμπεριλαμβανομένων haveibeentrained.com.

Η λειτουργία αναζήτησης στο haveibeentrained.com επιτρέπει στους χρήστες να εξερευνήσουν τις εικόνες που δίνουν τη δύναμη στην Stable Diffusion, και να ανακαλύψουν εάν τα αντικείμενα, άτομα ή ιδέες που θα ήθελαν να κληθούν από το σύστημα είναι πιθανό να έχουν εκπαιδευτεί σε αυτό. Τέτοιου είδους συστήματα είναι επίσης χρήσιμα για να ανακαλύψουν γειτονικές οντότητες, όπως ο τρόπος με τον οποίο οι διασημότητες είναι خوشοειδείς, ή η 'επόμενη ιδέα' που οδηγεί από την τρέχουσα. Πηγή: https://haveibeentrained.com/?search_text=bowl%20of%20fruit

Η λειτουργία αναζήτησης στο haveibeentrained.com επιτρέπει στους χρήστες να εξερευνήσουν τις εικόνες που δίνουν τη δύναμη στην Stable Diffusion, και να ανακαλύψουν εάν τα αντικείμενα, άτομα ή ιδέες που θα ήθελαν να κληθούν από το σύστημα είναι πιθανό να έχουν εκπαιδευτεί σε αυτό. Πηγή: https://haveibeentrained.com/?search_text=bowl%20of%20fruit

Αν και τέτοιες διαδικτυακές βάσεις δεδομένων συχνά αποκαλύπτουν κάποια από τα tags που συνοδεύουν τις εικόνες, η διαδικασία γενίκευσης που λαμβάνει χώρα κατά τη διάρκεια της εκπαίδευσης του μοντέλου σημαίνει ότι είναι απίθανο ότι οποιαδήποτε εικόνα θα μπορούσε να κληθεί χρησιμοποιώντας το tag ως προώθηση.

Επιπλέον, η αφαίρεση ‘stop words’ και η πρακτική της stemming και lemmatization στη φυσική γλώσσα σημαίνει ότι πολλά από τις φράσεις που εμφανίζονται ήταν χωρισμένες ή παραλείπονταν πριν από την εκπαίδευση στην Stable Diffusion.

Ωστόσο, ο τρόπος με τον οποίο οι αισθητικές ομαδοποιήσεις δένουν μαζί σε αυτές τις διεπαφές μπορεί να διδάξει τον τελικό χρήστη πολύ για τη λογική (ή, επιχειρηματικά, τη ‘προσωπικότητα’) της Stable Diffusion, και να αποδειχθεί ως βοήθημα για την καλύτερη παραγωγή εικόνων.

Συμπέρασμα

Υπάρχουν πολλά άλλα χαρακτηριστικά που θα ήθελα να δω σε μια πλήρη εγγενή εφαρμογή της Stable Diffusion, όπως εγγενή CLIP-βασισμένη ανάλυση εικόνας, η οποία αντιστρέφει τη τυπική διαδικασία της Stable Diffusion και επιτρέπει στον χρήστη να κληθεί φράσεις και λέξεις που το σύστημα θα συνήθως συνδέει με την πηγή εικόνας, ή την απόδοση.

Επιπλέον, αληθινή tile-βασισμένη κλιμάκωση θα ήταν μια ευπρόσδεκτη προσθήκη, поскольку η ESRGAN είναι σχεδόν τόσο αμβλύ όργανο όσο και το GFPGAN. Ευτυχώς, σχέδια για την ενσωμάτωση της txt2imghd υλοποίησης του GOBIG είναι γρήγορα κάνουν αυτό μια πραγματικότητα σε όλες τις διανομές, και φαίνεται μια προφανής επιλογή για μια εγγενή έκδοση.

Κάποια άλλα δημοφιλή αιτήματα από τις κοινότητες Discord με ενδιαφέρουν λιγότερο, όπως εγγενείς λεξικού προώθησης και εφαρμοστέες λίστες καλλιτεχνών και στυλ, αν και ένα εσωτερικό σημειωματάριο ή ένα προσαρμόσιμο λεξικό φράσεων θα φαινόταν μια λογική προσθήκη.

Η τρέχουσα περιορισμένη ανθρώπινη κίνηση στην Stable Diffusion, αν και έχει ξεκινήσει από το CogVideo και άλλα έργα, παραμένει εξαιρετικά πρωτογενή, και υπό την επιρροή της ανώτερης έρευνας για χρονικούς προηγούμενους που σχετίζονται με αυθεντική ανθρώπινη κίνηση.

Για τώρα, το βίντεο της Stable Diffusion είναι αυστηρά ψυχεδελικό, αν και μπορεί να έχει ένα πολύ πιο φωτεινό κοντινό μέλλον στη deepfake κούκλα, μέσω EbSynth και άλλων σχετικά πρωτογενών text-to-video πρωτοβουλιών (και αξίζει να σημειωθεί την απουσία συνθετικών ή ‘αλλαγμένων’ ανθρώπων στο τελευταίο προωθητικό βίντεο της Runway).

Μια άλλη πολύτιμη λειτουργικότητα θα ήταν διαφανής Photoshop πέρασμα, που έχει ήδη καθιερωθεί στο texture editor του Cinema4D, μεταξύ άλλων παρόμοιων υλοποιήσεων. Με αυτό, μπορείτε να μεταφέρετε εύκολα εικόνες μεταξύ εφαρμογών και να χρησιμοποιήσετε κάθε εφαρμογή για να εκτελέσει τις μεταμορφώσεις που είναι καλά σε αυτές.

Τέλος, και ίσως το πιο σημαντικό, μια πλήρη εφαρμογή της Stable Diffusion θα πρέπει να είναι σε θέση όχι μόνο να εναλλάσσεται εύκολα μεταξύ checkpoints (δηλ. εκδόσεων του υποκείμενου μοντέλου που δίνει τη δύναμη στο σύστημα), αλλά θα πρέπει επίσης να είναι σε θέση να ενημερώσει custom-δημιουργημένες Textual Inversions που δούλεψαν με προηγούμενες επίσημες εκδόσεις του μοντέλου, αλλά μπορεί να είναι κατεστραμμένες από μεταγενέστερες εκδόσεις του μοντέλου (όπως οι dévelopers στο επίσημο Discord έχουν υποδείξει ότι θα μπορούσε να συμβεί).

Ιронικά, η οργάνωση που είναι στην καλύτερη θέση για να δημιουργήσει ένα τόσο ισχυρό και ολοκληρωμένο πλέγμα εργαλείων για την Stable Diffusion, η Adobe, έχει συμμαχήσει τόσο ισχυρά με την Content Authenticity Initiative που θα φαινόταν μια retrograde PR λάθος για την εταιρεία – εκτός αν θα απογυμνώσει την Stable Diffusion από τις γεννητικές της δυνάμεις τόσο彻底 όσο και η OpenAI έχει κάνει με το DALL-E 2, και τη θέσει ως μια φυσική εξέλιξη των σημαντικών της συμμετοχών στη φωτογραφία stock.

 

Πρώτη δημοσίευση 15ης Σεπτεμβρίου 2022.

Συγγραφέας για μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]