Μοντέλα και πλατφόρμες AI
Η Stability AI κυκλοφορεί το μοντέλο κειμένου-εικόνας DeepFloyd IF

Stability AI και το πολυμορφικό εργαστήριο έρευνας AI, DeepFloyd, ανακοίνωσαν την έρευνα για την κυκλοφορία του DeepFloyd IF, ενός μοντέλου κειμένου-εικόνας με κασκαντίζουσα πίξελ διάχυση. Το μοντέλο κυκλοφορεί αρχικά υπό μια μη εμπορική, έρευνα-επιτρεπτή άδεια, αλλά μια ανοιχτή πηγή κυκλοφορίας προγραμματίζεται για το μέλλον.
Το DeepFloyd IF διαθέτει πολλές αξιοσημείωτες λειτουργίες, συμπεριλαμβανομένων:
- Βαθιά κατανόηση κειμένου-πρότασης: Το μοντέλο χρησιμοποιεί το T5-XXL-1.1 ως κωδικοποιητή κειμένου, με πολλαπλά στρώματα δια-προσοχής κειμένου-εικόνας, εξασφαλίζοντας καλύτερη ευθυγράμμιση μεταξύ προτάσεων και εικόνων.
- Συνεκτική και σαφής κείμενο μαζί με τις γεννημένες εικόνες: Το DeepFloyd IF μπορεί να γεννήσει εικόνες που περιέχουν αντικείμενα με ποικίλες ιδιότητες και χωρικές σχέσεις.
- Υψηλός βαθμός φωτορεαλισμού: Το μοντέλο έχει επιτύχει ένα εντυπωσιακό μηδενικό-πυροβολισμό FID σκορ 6.66 στο σύνολο δεδομένων COCO.
- Μετατόπιση αναλογίας: Το μοντέλο μπορεί να γεννήσει εικόνες με μη τυποποιημένες αναλογίες, συμπεριλαμβανομένων των κατακόρυφων, οριζόντιων και των τυποποιημένων τετραγωνικών αναλογιών.
- Μηδενικός-πυροβολισμός μετάφραση εικόνας-εικόνας: Το μοντέλο μπορεί να τροποποιήσει το στυλ, τα σχέδια και τις λεπτομέρειες μιας εικόνας ενώ διατηρεί τη βασική της μορφή.
Παρακάτω είναι einige από τις концепτικές εικόνες που δημιουργήθηκαν από το DeepFloyd IF:




Η κασκαντίζουσα πίξελ διάχυση του DeepFloyd IF αποτελείται από πολλά νευρωνικά μοντέλα που αλληλεπιδρούν συναρμόζως. Το μοντέλο λειτουργεί στο χώρο pixel, επεξεργαζόμενο υψηλής ανάλυσης δεδομένα με κασκαντίζον τρόπο χρησιμοποιώντας μοντέλα που έχουν εκπαιδευτεί ξεχωριστά σε διαφορετικές ανάλυσεις. Αυτό περιλαμβάνει ένα βασικό μοντέλο που γεννά δείγματα χαμηλής ανάλυσης και επιτυχόμενα μοντέλα υψηλής ανάλυσης που παράγουν εικόνες υψηλής ανάλυσης.
Το μοντέλο εκπαιδεύτηκε σε ένα προσαρμοσμένο υψηλής ποιότητας σύνολο δεδομένων LAION-A που περιέχει 1 δισεκατομμύριο (εικόνα, κείμενο) ζευγάρια, ένα υποσύνολο του αγγλικού μέρους του συνόλου δεδομένων LAION-5B. Οι προσαρμοσμένες φίλτρες του DeepFloyd χρησιμοποιήθηκαν για να αφαιρεθούν υδατοσημασμένες, NSFW και άλλες ακατάλληλες περιεχομένου.

Η διαδικασία του DeepFloyd IF
Αρχικά, το DeepFloyd IF κυκλοφορεί υπό μια έρευνα-άδεια. Οι ερευνητές στοχεύουν να ενθαρρύνουν την ανάπτυξη καινοτόμων εφαρμογών σε τομείς όπως η τέχνη, ο σχεδιασμός, η αφήγηση, η εικονική πραγματικότητα και η προσβασιμότητα. Για να εμπνεύσουν πιθανή έρευνα, έχουν προτείνει beberapa τεχνικές, ακαδημαϊκές και ηθικές ερευνητικές ερωτήσεις.
Τεχνικές ερευνητικές ερωτήσεις περιλαμβάνουν:
- Βελτίωση του μοντέλου IF για να βελτιώσει την απόδοση, την κλιμακωσιμότητα και την αποτελεσματικότητα.
- Βελτίωση της ποιότητας της έξοδου με την επιμέρους δειγματοληψία, την καθοδήγηση ή την λεπτομέρεια του μοντέλου.
- Εφαρμογή τεχνικών που χρησιμοποιούνται για να τροποποιήσουν την έξοδο της σταθερής διάχυσης στο DeepFloyd IF.
Ακαδημαϊκές ερευνητικές ερωτήσεις περιλαμβάνουν:
- Εξέταση του ρόλου της προ-εκπαίδευσης για τη μεταφορά μάθησης.
- Βελτίωση του ελέγχου του μοντέλου πάνω στην γεννήθηκε εικόνα.
- Διεύρυνση των ικανοτήτων του μοντέλου πέρα από τη σύνθεση κειμένου-εικόνας με την ενσωμάτωση πολλαπλών модαλитетων.
- Αξιολόγηση της ερμηνευσιμότητας του μοντέλου για να βελτιώσει την κατανόηση των οπτικών χαρακτηριστικών των γεννημένων εικόνων.
Ηθικές ερευνητικές ερωτήσεις περιλαμβάνουν:
- Τayiποίηση και μείωση των προκαταλήψεων στο DeepFloyd IF.
- Αξιολόγηση του αντικτύπου του μοντέλου στα κοινωνικά μέσα και την παραγωγή περιεχομένου.
- Ανάπτυξη ενός αποτελεσματικού ανιχνευτή ψευδούς εικόνας που χρησιμοποιεί το μοντέλο.
Για να αποκτήσετε πρόσβαση στα βάρη του μοντέλου, οι χρήστες πρέπει να αποδεχτούν την άδεια στο χώρο Hugging Face του DeepFloyd. Για περισσότερες πληροφορίες, μπορείτε να επισκεφτείτε την ιστοσελίδα του μοντέλου, το αποθετήριο GitHub, την επίδειξη Gradio ή να συμμετάσχετε σε δημόσιες συζητήσεις μέσω του Linktree του DeepFloyd.












