Μοντέλα και πλατφόρμες AI

StreamDiffusion: Μια Λύση Επιπέδου Πipeline για Παρεμβολή σε Εchtzeit

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
StreamDiffusion: A Pipeline-level Solution for Real-time Interactive Generation

Λόγω του τεράστιου δυναμικού και των εμπορικών ευκαιριών, ιδιαίτερα στο gaming, την μετάδοση και τη ροή βίντεο, το Metaverse είναι σήμερα μια από τις ταχύτερα αναπτυσσόμενες τεχνολογίες. Οι σύγχρονες εφαρμογές Metaverse χρησιμοποιούν πλαισιά για την τεχνητή νοημοσύνη, συμπεριλαμβανομένης της υπολογιστικής όρασης και των μοντέλων διασποράς, για να βελτιώσουν τον ρεαλισμό τους. Μια σημαντική πρόκληση για τις εφαρμογές Metaverse είναι η ενσωμάτωση διαφόρων πιπελίνων διασποράς που παρέχουν χαμηλή καθυστέρηση και υψηλή απόδοση, εξασφαλίζοντας αποτελεσματική αλληλεπίδραση μεταξύ ανθρώπων και αυτών των εφαρμογών.

Οι σύγχρονες πλαισιώσεις AI που βασίζονται στη διασπορά exceling στη δημιουργία εικόνων από κειμενικές ή εικονικές προτροπές, αλλά αποτυγχάνουν σε αλληλεπιδράσεις σε εchtzeit. Αυτό το όριο είναι ιδιαίτερα εμφανές σε εργασίες που απαιτούν συνεχείς εισαγωγές και υψηλή απόδοση, όπως η γραφική παράσταση βιντεοπαιχνιδιών, οι εφαρμογές Metaverse, η μετάδοση και η ζωντανή ροή βίντεο.

Σε αυτό το άρθρο, θα συζητήσουμε τη StreamDiffusion, μια πιπελίνα διασποράς σε εchtzeit που αναπτύχθηκε για τη δημιουργία αλληλεπιδραστικών και ρεαλιστικών εικόνων, αντιμετωπίζοντας τις τρέχουσες περιορισμούς των πλαισιώσεων που βασίζονται στη διασπορά σε εργασίες που涉ρούν συνεχείς εισαγωγές. Η StreamDiffusion είναι μια καινοτόμος προσέγγιση που μετατρέπει τη συνεχή θόλωση της αρχικής εικόνας σε θόλωση批, με στόχο να ενεργοποιήσει υψηλή απόδοση και ροή. Αυτή η προσέγγιση απομακρύνεται από την παραδοσιακή μέθοδο “περιμένω και αλληλεπιδρώ” που χρησιμοποιούνται από τις υπάρχουσες πλαισιώσεις που βασίζονται στη διασπορά. Σε τις επόμενες ενότητες, θα αναλύσουμε την πιπελίνα StreamDiffusion σε λεπτομέρειες, εξετάζοντας τη λειτουργία, την αρχιτεκτονική και τα συγκριτικά αποτελέσματα ενάντια στις τρέχουσες πλαισιώσεις. Ας ξεκινήσουμε.

StreamDiffusion : Μια Εισαγωγή στη Διασπορά σε Εchtzeit

Οι εφαρμογές Metaverse είναι επικεντρωμένες σε απόδοση, επεξεργάζονται μεγάλο όγκο δεδομένων, συμπεριλαμβανομένων κειμένων, animacji, βίντεο και εικόνων σε εchtzeit, για να παρέχουν στους χρήστες τις διαδραστικές διεπαφές και την εμπειρία τους. Οι σύγχρονες εφαρμογές Metaverse βασίζονται σε πλαισιά για την τεχνητή νοημοσύνη, συμπεριλαμβανομένης της υπολογιστικής όρασης, της επεξεργασίας εικόνων και των μοντέλων διασποράς, για να επιτύχουν χαμηλή καθυστέρηση και υψηλή απόδοση, εξασφαλίζοντας μια αψεγάδιαστη εμπειρία χρήστη. Τώρα, η πλειοψηφία των εφαρμογών Metaverse βασίζεται στη μείωση της συχνότητας των επαναλήψεων της διασποράς για να εξασφαλίσει υψηλή απόδοση και να ενισχύσει τις αλληλεπιδραστικές ικανότητες σε εchtzeit. Αυτά τα πλαισιά ακολουθούν μια κοινή στρατηγική, η οποία είτε περιλαμβάνει την αναδιατύπωση της διαδικασίας διασποράς με νευρωνικά ΟΔΕ (Συνήθεις Διαφορικές Εξισώσεις) είτε μειώνει τα μοντέλα διασποράς πολλαπλών βημάτων σε λίγα βήματα ή ακόμη και σε ένα βήμα. Αν και αυτή η προσέγγιση παρέχει ικανοποιητικά αποτελέσματα, έχει ορισμένα περιορισμοί, συμπεριλαμβανομένης της περιορισμένης ευελιξίας και των υψηλών υπολογιστικών κοστών.

Από την άλλη πλευρά, η StreamDiffusion είναι μια λύση επιπέδου πιπελίνας που ξεκινά από μια ορθογώνια κατεύθυνση και ενισχύει τις ικανότητες του πλαισίου για τη δημιουργία αλληλεπιδραστικών εικόνων σε εchtzeit, εξασφαλίζοντας υψηλή απόδοση. Η StreamDiffusion χρησιμοποιεί μια απλή στρατηγική, όπου αντί να θολώνει την αρχική εισαγωγή, το πλαισίο θολώνει το βήμα της θόλωσης. Η στρατηγική αυτή λαμβάνει έμπνευση από την ασύγχρονη επεξεργασία, καθώς το πλαισίο δεν πρέπει να περιμένει το πρώτο στάδιο της θόλωσης να ολοκληρωθεί πριν μπορέσει να προχωρήσει στο δεύτερο στάδιο, όπως φαίνεται στην ακόλουθη εικόνα. Για να αντιμετωπίσουμε το ζήτημα της συχνότητας επεξεργασίας του U-Net και της συχνότητας εισαγωγής, η πιπελίνα StreamDiffusion εφαρμόζει μια στρατηγική ουράς για να αποθηκεύσει την εισαγωγή και τις εξαγωγές.

Αν και η πιπελίνα StreamDiffusion λαμβάνει έμπνευση από την ασύγχρονη επεξεργασία, είναι μοναδική με τον δικό της τρόπο, καθώς εφαρμόζει παραλληλισμό GPU που επιτρέπει στο πλαισίο να χρησιμοποιήσει ένα μόνο στοιχείο U-Net για να θολώσει μια θολωμένη Funktion. Επιπλέον, τα υπάρχοντα πλαισιά που βασίζονται στη διασπορά τονίζουν την έμφαση στα δοθέντα προτροπές στις γεννημένες εικόνες, ενσωματώνοντας την καθοδήγηση του ταξινομητή, ως αποτέλεσμα του οποίου τα τρέχοντα πλαισιά είναι γεμάτα με περιττές και υπερβολικές υπολογιστικές επιβαρύνσεις. Για να εξασφαλίσουμε ότι η πιπελίνα StreamDiffusion δεν αντιμετωπίζει τα ίδια προβλήματα, εφαρμόζει μια καινοτόμο προσέγγιση RCFG ή Residual Classifier-Free Guidance, η οποία χρησιμοποιεί einen εικονικό υπολοιπο θόλωσης για να προσεγγίσει τις αρνητικές συνθήκες, επιτρέποντας στο πλαισίο να υπολογίσει τις αρνητικές συνθήκες θόλωσης στις αρχικές φάσεις της διαδικασίας. Επιπλέον, η πιπελίνα StreamDiffusion μειώνει τις υπολογιστικές απαιτήσεις ενός παραδοσιακού πλαισίου διασποράς, εφαρμόζοντας μια στρατηγική φιλτραρίσματος στοχαστικής ομοιότητας που καθορίζει εάν το πλαισίο πρέπει να επεξεργαστεί τις εικόνες εισαγωγής, υπολογίζοντας τις ομοιότητες μεταξύ συνεχών εισαγωγών.

Η πιπελίνα StreamDiffusion είναι χτισμένη στις γνώσεις των μοντέλων διασποράς και των μοντέλων επιτάχυνσης διασποράς.

Τα μοντέλα διασποράς είναι γνωστά για τις εξαιρετικές ικανότητες δημιουργίας εικόνων και τον έλεγχο που προσφέρουν. Λόγω των ικανοτήτων τους, τα μοντέλα διασποράς έχουν βρει εφαρμογές στην επεξεργασία εικόνων, τη δημιουργία εικόνων από κείμενο και τη δημιουργία βίντεο. Επιπλέον, η ανάπτυξη συνετών μοντέλων έχει δείξει το δυναμικό να βελτιώσει την απόδοση δειγματοληψίας χωρίς να επηρεάσει την ποιότητα των εικόνων που παράγονται από το μοντέλο, ανοίγοντας νέες πόρτες για να επεκτείνουν την εφαρμοσιμότητα και την αποτελεσματικότητα των μοντέλων διασποράς, μειώνοντας τον αριθμό των βημάτων δειγματοληψίας. Αν και είναι εξαιρετικά ικανά, τα μοντέλα διασποράς έχουν ένα σημαντικό όριο: η αργή δημιουργία εικόνων. Για να αντιμετωπίσουμε αυτό το όριο, οι dévelopπεurs εισήγαγαν τα επιταχυνόμενα μοντέλα διασποράς, πλαισιά που βασίζονται στη διασπορά που δεν απαιτούν πρόσθετα βήματα εκπαίδευσης ή εφαρμόζουν στρατηγικές προβλέψεων-διορθώσεων και λύσεων προσαρμοσμένων βημάτων για να αυξήσουν την ταχύτητα εξόδου.

Ο διακριτικός παράγοντας μεταξύ StreamDiffusion και των παραδοσιακών πλαισιών που βασίζονται στη διασπορά είναι ότι ενώ το δεύτερο επικεντρώνεται πρωτίστως στη χαμηλή καθυστέρηση των μεμονωμένων μοντέλων, το πρώτο εισάγει μια προσέγγιση επιπέδου πιπελίνας που σχεδιάζεται για την επίτευξη υψηλών αποδόσεων, ενεργοποιώντας την αποτελεσματική αλληλεπίδραση διασποράς.

StreamDiffusion : Λειτουργία και Αρχιτεκτονική

Η πιπελίνα StreamDiffusion είναι μια πιπελίνα διασποράς σε εchtzeit που αναπτύχθηκε για τη δημιουργία αλληλεπιδραστικών και ρεαλιστικών εικόνων, και απαρτίζεται από 6 βασικά στοιχεία: RCFG ή Residual Classifier Free Guidance, στρατηγική Stream Batch, φίλτρο στοχαστικής ομοιότητας, ουρά εισαγωγής-εξαγωγής, εργαλεία επιτάχυνσης μοντέλου με autoencoder και διαδικασία προ-υπολογισμού. Ας μιλήσουμε για αυτά τα στοιχεία σε λεπτομέρειες.

Στρατηγική Stream Batch

Παραδοσιακά, τα βήματα θόλωσης σε ένα μοντέλο διασποράς εκτελούνται συνεχώς, με αποτέλεσμα μια σημαντική αύξηση του χρόνου επεξεργασίας του U-Net. Ωστόσο, είναι απαραίτητο να αυξηθεί ο αριθμός των βημάτων επεξεργασίας για να παραχθούν εικόνες υψηλής πιστότητας, και η πιπελίνα StreamDiffusion εισάγει τη στρατηγική Stream Batch για να αντιμετωπίσουμε το πρόβλημα της υψηλής καθυστέρησης στις αλληλεπιδραστικές πλαισιώσεις διασποράς.

Στη στρατηγική Stream Batch, οι συνεχείς επιχειρήσεις θόλωσης αναδιατάσσονται σε διαδικασίες批, με κάθε批 να αντιστοιχεί σε έναν προκαθορισμένο αριθμό βημάτων θόλωσης, και ο αριθμός αυτών των βημάτων θόλωσης καθορίζεται από το μέγεθος κάθε批. Χάρη σε αυτήν την προσέγγιση, κάθε στοιχείο στη批 μπορεί να προχωρήσει ένα βήμα παραπέρα χρησιμοποιώντας το μόνο passthrough U-Net στη διαδικασία θόλωσης. Εφαρμόζοντας τη στρατηγική Stream Batch επαναλαμβανόμενα, οι εικόνες εισαγωγής που κωδικοποιούνται στο χρονικό σημείο “t” μπορούν να μετατραπούν στις αντίστοιχες εικόνες-εικόνες αποτελέσματα στο χρονικό σημείο “t+n”, επιταχύνοντας τη διαδικασία θόλωσης.

Residual Classifier Free Guidance

Η CFG ή Classifier Free Guidance είναι ένας αλγόριθμος AI που εκτελεί μια σειρά από διανυσματικές υπολογίσεις μεταξύ του αρχικού όρου προϋποθέσεων και ενός αρνητικού όρου προϋποθέσεων ή απροϋπόθετου όρου για να ενισχύσει την επίδραση του αρχικού όρου προϋποθέσεων. Ο αλγόριθμος ενισχύει την επίδραση της προτροπής, ακόμη και αν για να υπολογίσει την αρνητική προϋπόθεση του θορύβου, είναι απαραίτητο να ζευγαρώσει μεμονωμένα εισαγόμενα υπολοιπά με αρνητικές προϋποθέσεις και να τα περάσει через το U-Net στο χρόνο αναφοράς.

Για να αντιμετωπίσουμε αυτό το ζήτημα που προβάλλεται από τον αλγόριθμο Classifier Free Guidance, η πιπελίνα StreamDiffusion εισάγει τον αλγόριθμο Residual Classifier Free Guidance με στόχο να μειώσει τις υπολογιστικές απαιτήσεις για πρόσθετη παρέμβαση του U-Net για αρνητική προϋπόθεση. Πρώτα, η κωδικοποιημένη είσοδος υπολοιπών μεταφέρεται στη διανομή θορύβου χρησιμοποιώντας τις τιμές που καθορίζονται από το πρόγραμμα θορύβου. Μόλις έχει εφαρμοστεί το μοντέλο συνετής, ο αλγόριθμος μπορεί να προβλέψει τη διανομή δεδομένων και να χρησιμοποιήσει το CFG υπολοιπών θορύβου για να γεννήσει τη διανομή θορύβου του επόμενου βήματος.

Ουρά Εισαγωγής-Εξαγωγής

Το κύριο ζήτημα με τις πλαισιώσεις υψηλής ταχύτητας είναι τα νευρωνικά μοντέλα, συμπεριλαμβανομένων των στοιχείων U-Net και VAE. Για να μεγιστοποιήσετε την αποτελεσματικότητα και την ταχύτητα εξόδου, οι πλαισιώσεις επεξεργασίας εικόνων μεταφέρουν διαδικασίες όπως η προ-επεξεργασία και η μετα-επεξεργασία εικόνων που δεν απαιτούν πρόσθετη επεξεργασία από τα νευρωνικά μοντέλα, έξω από την πιπελίνα, και στη συνέχεια τις επεξεργάζονται παράλληλα. Επιπλέον, όσον αφορά την επεξεργασία της εικόνας εισαγωγής, συγκεκριμένες επιχειρήσεις, συμπεριλαμβανομένης της μετατροπής του τύπου tensor, της αναδιαμόρφωσης της εικόνας εισαγωγής και της ομαλοποίησης, εκτελούνται από την πιπελίνα με προσοχή.

Για να αντιμετωπίσουμε την ανισότητα των συχνότητας επεξεργασίας μεταξύ της απόδοσης του μοντέλου και της ανθρώπινης εισαγωγής, η πιπελίνα ενσωματώνει ένα σύστημα ουράς εισαγωγής-εξαγωγής που επιτρέπει την αποτελεσματική παραλληλοποίηση, όπως φαίνεται στην ακόλουθη εικόνα.

Οι επεξεργασμένες tensors εισαγωγής αποθηκεύονται πρώτα μεθοδικά για τα μοντέλα διασποράς, και κατά τη διάρκεια κάθε πλαισίου, το μοντέλο ανακτά την πιο πρόσφατη tensor από την ουρά εισαγωγής και την προωθεί στο VAE encoder, ξεκινώντας τη διαδικασία δημιουργίας εικόνων. Ταυτόχρονα, η tensor εξόδου από το VAE decoder προωθείται στην ουρά εξαγωγής. Τέλος, τα δεδομένα εικόνας εξαγωγής μεταδίδονται στον πελάτη απόδοσης.

Φίλτρο Σтоχαστικής Ομοιότητας

Σε σενάρια όπου οι εικόνες παραμένουν αμετάβλητες ή δείχνουν ελάχιστες αλλαγές χωρίς στατικό περιβάλλον ή χωρίς ενεργό αλληλεπίδραση χρήστη, εικόνες εισαγωγής που μοιάζουν μεταξύ τους εισάγονται επαναλαμβανόμενα στα στοιχεία U-Net και VAE. Η επαναλαμβανόμενη εισαγωγή οδηγεί στη δημιουργία σχεδόν идентικών εικόνων και στην πρόσθετη κατανάλωση πόρων GPU. Επιπλέον, σε σενάρια που涉ρούν συνεχείς εισαγωγές, αμετάβλητες εικόνες εισαγωγής μπορεί να εμφανιστούν περιστασιακά. Για να αντιμετωπίσουμε αυτό το ζήτημα και να αποτρέψουμε την περιττή χρήση πόρων, η πιπελίνα StreamDiffusion εφαρμόζει ένα στοιχείο φίλτρου στοχαστικής ομοιότητας στη πιπελίνα. Το φίλτρο στοχαστικής ομοιότητας υπολογίζει πρώτα την ομοιότητα cosine μεταξύ της εικόνας αναφοράς και της εικόνας εισαγωγής, και χρησιμοποιεί το σκορ ομοιότητας για να υπολογίσει την πιθανότητα να παραλείψει τις επόμενες διαδικασίες U-Net και VAE.

Βάσει του σκορ πιθανότητας, η πιπελίνα αποφασίζει εάν θα παραλείψει τις επόμενες διαδικασίες όπως η κωδικοποίηση VAE, η αποκωδικοποίηση VAE και το U-Net. Εάν αυτές οι διαδικασίες δεν παραλείπονται, η πιπελίνα αποθηκεύει την εικόνα εισαγωγής εκείνη την ώρα και ταυτόχρονα ενημερώνει την εικόνα αναφοράς που θα χρησιμοποιηθεί στο μέλλον. Αυτή η πιθανότητα-βασισμένη μηχανισμός παραλείψεως επιτρέπει στην πιπελίνα StreamDiffusion να λειτουργήσει πλήρως σε δυναμικά σενάρια με χαμηλή ομοιότητα μεταξύ πλαισίων, ενώ σε στατικά σενάρια, η πιπελίνα λειτουργεί με υψηλότερη ομοιότητα μεταξύ πλαισίων. Η προσέγγιση αυτή βοηθά στην εξοικονόμηση των υπολογιστικών πόρων και επίσης εξασφαλίζει την βέλτιστη χρήση GPU βάσει της ομοιότητας των εικόνων εισαγωγής.

Προ-υπολογισμός

Η αρχιτεκτονική U-Net απαιτεί τόσο τις προϋποθέσεις όσο και τις εισαγόμενα υπολοιπά. Παραδοσιακά, οι προϋποθέσεις προέρχονται από τις προϋποθέσεις που παραμένουν σταθερές σε όλα τα πλαισιά. Για να βελτιστοποιήσετε την ανάκτηση από τις προϋποθέσεις, η πιπελίνα StreamDiffusion προ-υπολογίζει αυτές τις προϋποθέσεις και τις αποθηκεύει σε μια cache, η οποία στη συνέχεια καλείται σε λειτουργία ροής ή αλληλεπίδρασης. Μέσα στην αρχιτεκτονική U-Net, το ζευγάρι Key-Value υπολογίζεται βάσει κάθε πλαισίου προ-υπολογισμένης προϋπόθεσης, και με μικρές τροποποιήσεις στο U-Net, αυτά τα ζευγάρια Key-Value μπορούν να επαναχρησιμοποιηθούν.

Επιτάχυνση Μοντέλου και Tiny AutoEncoder

Η πιπελίνα StreamDiffusion χρησιμοποιεί το TensorRT, ένα εργαλείο βελτιστοποίησης από την Nvidia (NVDA ) για τις διεπαφές του deep learning, για να κατασκευάσει τα κινητά VAE και U-Net, για να επιταχύνει την ταχύτητα inference. Για να το επιτύχει αυτό, το TensorRT εκτελεί πολλές βελτιστοποιήσεις στα νευρωνικά δίκτυα που σχεδιάζονται για να αυξήσουν την αποτελεσματικότητα και την απόδοση για τις εφαρμογές του deep learning.

Για να βελτιστοποιήσει την ταχύτητα, η πιπελίνα StreamDiffusion ρυθμίζει το πλαισίο για να χρησιμοποιήσει σταθερές διαστάσεις εισαγωγής και στατικές μεγέθη批 για να εξασφαλίσει την βέλτιστη ανάθεση μνήμης και τους υπολογιστικούς γραφικούς για ένα συγκεκριμένο μέγεθος εισαγωγής, σε μια προσπάθεια να επιτύχει ταχύτερες χρόνους επεξεργασίας.

Η παραπάνω εικόνα παρέχει μια επισκόπηση της πιπελίνας inference. Η πιπελίνα πυρήνα στεγάζει τα στοιχεία U-Net και VAE. Η πιπελίνα ενσωματώνει μια θόλωση批, μια cache θορύβου, μια cache προ-υπολογισμένων προϋποθέσεων και μια cache τιμών προγραμματισμού για να βελτιστοποιήσει την ταχύτητα και την ικανότητα της πιπελίνας να παράγει εικόνες σε εchtzeit. Το φίλτρο στοχαστικής ομοιότητας ή SSF εφαρμόζεται για να βελτιστοποιήσει την χρήση GPU και επίσης για να ελέγξει τη διέλευση του μοντέλου διασποράς δυναμικά.

StreamDiffusion : Πειράματα και Αποτελέσματα

Για να αξιολογήσει τις ικανότητές της, η πιπελίνα StreamDiffusion εφαρμόζεται στα πλαισιά LCM και SD-turbo. Το TensorRT της Nvidia χρησιμοποιείται ως επιταχυντής μοντέλου, και για να ενεργοποιήσει την ελαφριά αποτελεσματικότητα VAE, η πιπελίνα χρησιμοποιεί το στοιχείο TAESD. Ας δούμε πώς η πιπελίνα StreamDiffusion εκτελείται όταν συγκρίνεται με τα τρέχοντα πλαισιά.

Ποσοτική Αξιολόγηση

Η ακόλουθη εικόνα δείχνει την σύγκριση αποτελεσματικότητας μεταξύ του αρχικού συνεχούς U-Net και του στοιχείου θόλωσης批 στην πιπελίνα, και όπως φαίνεται, η εφαρμογή της προσέγγισης θόλωσης批 μειώνει σημαντικά τον χρόνο επεξεργασίας, σχεδόν 50%, όταν συγκρίνεται με τις παραδοσιακές βρόχους U-Net σε συνεχείς βήματα θόλωσης.

Επιπλέον, ο μέσος χρόνος inference σε διαφορετικά βήματα θόλωσης βιώνει επίσης μια σημαντική βελτίωση με διαφορετικούς παράγοντες ταχύτητας όταν συγκρίνεται με τα τρέχοντα πλαισιά, και τα αποτελέσματα παρουσιάζονται στην ακόλουθη εικόνα.

Συνεχίζοντας, η πιπελίνα StreamDiffusion με το στοιχείο RCFG δείχνει λιγότερο χρόνο inference όταν συγκρίνεται με πλαισιά που περιλαμβάνουν το παραδοσιακό στοιχείο CFG.

Επιπλέον, ο αντίκτυπος της χρήσης του στοιχείου RCFG είναι εμφανής στην ακόλουθη εικόνα όταν συγκρίνεται με τη χρήση του στοιχείου CFG.

Όπως φαίνεται, η χρήση του CFG ενισχύει την επίδραση της κειμενικής προτροπής στη δημιουργία εικόνων, και η εικόνα μοιάζει πολύ περισσότερο με την είσοδο προτροπής όταν συγκρίνεται με τις εικόνες που παράγονται από την πιπελίνα χωρίς τη χρήση του στοιχείου CFG. Τα αποτελέσματα βελτιώνονται περαιτέρω με τη χρήση του στοιχείου RCFG, καθώς η επίδραση των προτροπών στις γεννημένες εικόνες είναι πολύ σημαντική όταν συγκρίνεται με το αρχικό στοιχείο CFG.

Τελικές Σκέψεις

Σε αυτό το άρθρο, συζητήσαμε τη StreamDiffusion, μια πιπελίνα διασποράς σε εchtzeit που αναπτύχθηκε για τη δημιουργία αλληλεπιδραστικών και ρεαλιστικών εικόνων, αντιμετωπίζοντας τις τρέχουσες περιορισμούς που θέτουν τα πλαισιά που βασίζονται στη διασπορά σε εργασίες που涉ρούν συνεχείς εισαγωγές. Η StreamDiffusion είναι μια απλή και καινοτόμος προσέγγιση που στοχεύει να μετατρέψει τη συνεχή θόλωση της αρχικής εικόνας σε θόλωση批, με στόχο να ενεργοποιήσει υψηλή απόδοση και ροή. Η StreamDiffusion στοχεύει να ενεργοποιήσει υψηλή απόδοση και ροή, εξαλείφοντας την παραδοσιακή μέθοδο “περιμένω και αλληλεπιδρώ” που έχουν τα τρέχοντα πλαισιά που βασίζονται στη διασπορά. Οι πιθανές αποδοτικές κέρδη υπογραμμίζουν το δυναμικό της πιπελίνας StreamDiffusion για εμπορικές εφαρμογές που προσφέρουν υψηλή απόδοση υπολογιστών και ελκυστικές λύσεις για την τεχνητή νοημοσύνη.

Ένας μηχανικός επάγγελμα, ένας συγγραφέας με την καρδιά. Ο Kunal είναι ένας τεχνικός συγγραφέας με einen βαθύ έρωτα και κατανόηση του AI και ML, αφιερωμένος στο να απλοποιεί σύνθετες έννοιες σε αυτά τα πεδία μέσω των ελκυστικών και ενημερωτικών εγγράφων του.