Prompt engineering

Ένα Κοντινό Βλέμμα στο DALL-E 3 της OpenAI

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
DALL·E 3

Στον κόσμο της Γεννητικής Τεχνητής Νοημοσύνης, το να παραμένεις ενημερωμένος είναι το όνομα του παιχνιδιού. Και όταν πρόκειται για τη δημιουργία εικόνων, η Stable Diffusion και η Midjourney ήταν η πλατφόρμα που όλοι μιλούσαν – μέχρι τώρα.

Η OpenAI, που υποστηρίζεται από τον τεχνολογικό γίγαντα Microsoft (MSFT ), εισήγαγε το DALL·E 3 στις 20 Σεπτεμβρίου 2023.

Το DALL-E 3 δεν ασχολείται μόνο με τη δημιουργία εικόνων, αλλά με τη μεταφορά των ιδεών σας στη ζωή, ακριβώς όπως τις φανταζόσαστε. Και το καλύτερο μέρος; Είναι γρήγορο, σαν, πραγματικά γρήγορο. Έχετε μια ιδέα, τη δίνετε στο DALL-E 3 και μπουν, η εικόνα σας είναι έτοιμη.

Έτσι, σε αυτό το άρθρο, θα πάρουμε μια πιο κοντινή ματιά στο τι είναι το DALL-E 3. Θα μιλήσουμε για το πώς λειτουργεί, τι το διακρίνει από τα άλλα και γιατί μπορεί να είναι το εργαλείο που δεν ήξερε ότι χρειάζεστε. Αν είστε σχεδιαστής, καλλιτέχνης ή απλά κάποιος με πολλές καλές ιδέες, θα θέλατε να μείνετε εδώ για αυτό. Ας ξεκινήσουμε.

Τι είναι καινούριο στο DALL·E 3 είναι ότι καταλαβαίνει το контέκστ πολύ καλύτερα από το DALL·E 2. Οι προηγούμενες εκδόσεις μπορεί να έχαναν κάποια λεπτομέρειες ή να αγνοούσαν κάποιες λεπτομέρειες εδώ και εκεί, αλλά το DALL·E 3 είναι στο σημείο. Πιάνει τις ακριβείς λεπτομέρειες του τι ζητάτε, δίνοντάς σας μια εικόνα που είναι πιο κοντινή σε αυτό που φανταζόσαστε.

Το κούλ μέρος; Το DALL·E 3 και το ChatGPT είναι τώρα ενσωματωμένα μαζί. Συνεργάζονται για να βοηθήσουν στην εξευγενισμό των ιδεών σας. Βάζετε μια концепция, το ChatGPT σας βοηθά στην επιμελήωση της πρότασης και το DALL·E 3 τη φέρνει στη ζωή. Αν δεν σας αρέσει η εικόνα, μπορείτε να ζητήσετε από το ChatGPT να τροποποιήσει την πρόταση και να ζητήσετε από το DALL·E 3 να προσπαθήσει ξανά. Για einen μηνιαίο χρέωση των 20$, έχετε πρόσβαση στο GPT-4, το DALL·E 3 και πολλά άλλα κούλ χαρακτηριστικά.

Το Bing Chat της Microsoft έλαβε το DALL·E 3 ακόμη και πριν το ChatGPT της OpenAI, και τώρα δεν είναι μόνο οι μεγάλες εταιρείες αλλά και όλοι που μπορούν να παίξουν μαζί του δωρεάν. Η ενσωμάτωση στο Bing Chat και στο Bing Image Creator το καθιστά πολύ πιο εύχρηστο για όλους.

Η Άνοδος των Μοντέλων Diffusion

Τις τελευταίες 3 χρόνια, η τεχνητή νοημοσύνη έχει δει την άνοδο των μοντέλων diffusion, με ένα σημαντικό βήμα προς τα εμπρός, ιδιαίτερα στη δημιουργία εικόνων. Πριν από τα μοντέλα diffusion, τα Γεννητικά Αντισταθμιστικά Δίκτυα (GANs) ήταν η τεχνολογία που χρησιμοποιούνταν για τη δημιουργία πραγματικών εικόνων.

GANs

GANs

Ωστόσο, είχαν τις δικές τους προκλήσεις, συμπεριλαμβανομένης της ανάγκης για τεράστια ποσά δεδομένων και υπολογιστικής ισχύος, που συχνά τα έκανε δύσκολα να χειριστούν.

Εισαγωγή μοντέλων diffusion. Αυτά εμφανίστηκαν ως μια πιο σταθερή και αποτελεσματική εναλλακτική λύση για τα GANs. Σε αντίθεση με τα GANs, τα μοντέλα diffusion λειτουργούν προσθέτοντας θόρυβο στα δεδομένα, θολώνοντας τα μέχρι να μείνουν μόνο τυχαία δεδομένα. Στη συνέχεια, εργάζονται ανάποδα για να αναστρέψουν αυτή τη διαδικασία, ανακατασκευάζοντας σημαντικά δεδομένα από τον θόρυβο. Αυτή η διαδικασία έχει αποδειχθεί αποτελεσματική και λιγότερο πιεστική, καθιστώντας τα μοντέλα diffusion ένα热 topic στην κοινότητα της τεχνητής νοημοσύνης.

Ο πραγματικός σημείο καμπής ήρθε γύρω στο 2020, με μια σειρά καινοτόμων ερευνών και την εισαγωγή της τεχνολογίας CLIP της OpenAI, που προχώρησε σημαντικά τις ικανότητες των μοντέλων diffusion. Αυτό έκανε τα μοντέλα diffusion εξαιρετικά καλά στην σύνθεση εικόνων από κείμενο, επιτρέποντάς τους να δημιουργήσουν πραγματικές εικόνες από περιγραφές κειμένου. Αυτές οι прорывες δεν ήταν μόνο στη δημιουργία εικόνων, αλλά και σε πεδία όπως η σύνθεση μουσικής και η βιοϊατρική έρευνα.

Σήμερα, τα μοντέλα diffusion δεν είναι μόνο ένα θέμα ακαδημαϊκών ενδιαφερόντων, αλλά χρησιμοποιούνται και σε πρακτικές, πραγματικές καταστάσεις.

Γεννητική Μοντελοποίηση και Στρώματα Αυτοπροσοχής: DALL-E 3

Μια από τις κρίσιμες προόδους σε αυτό το πεδίο έχει sido η εξέλιξη της γεννητικής μοντελοποίησης, με προσεγγίσεις που βασίζονται στη δειγματοληψία όπως η αυτορεγουσατική γεννητική μοντελοποίηση και οι διαδικασίες diffusion να προηγούνται. Αυτές έχουν μεταμορφώσει τα μοντέλα εικόνας-κειμένου, οδηγώντας σε δραστικές βελτιώσεις της απόδοσης. Βάζοντας τη δημιουργία εικόνας σε διακριτά βήματα, αυτά τα μοντέλα έχουν γίνει πιο εύκολη στην εκμάθηση για τα νευρωνικά δίκτυα.

Παράλληλα, η χρήση στρωμάτων αυτοπροσοχής έχει παίξει ένα κρίσιμο ρόλο. Αυτά τα στρώματα, στοιβαγμένα μαζί, έχουν βοηθήσει στη δημιουργία εικόνων χωρίς την ανάγκη για σωρηδόν χωρικές προκαταλήψεις, ένα κοινό πρόβλημα με τις συναρτήσεις. Αυτή η μετατόπιση έχει επιτρέψει στα μοντέλα εικόνας-κειμένου να κλιμακωθούν και να βελτιωθούν με αξιοπιστία, λόγω των καλά κατανοητών ιδιοτήτων κλιμάκωσης των transformers.

Προκλήσεις και Λύσεις στη Δημιουργία Εικόνων

Παρά τις προόδους, η ελεγκτική στη δημιουργία εικόνων παραμένει μια πρόκληση. Ζητήματα όπως η ακολουθία της πρότασης, όπου το μοντέλο μπορεί να μην ακολουθήσει στενά το κείμενο εισόδου, έχουν υπάρξει διαδεδομένα. Για να αντιμετωπιστούν αυτά, έχουν προταθεί νέες προσεγγίσεις όπως η βελτίωση των legend, που στοχεύουν στην ενίσχυση της ποιότητας των ζευγών κειμένου-εικόνας στα σύνολα δεδομένων εκπαίδευσης.

Βελτίωση Legend: Μια Νέα Προσέγγιση

Η βελτίωση legend περιλαμβάνει τη δημιουργία καλύτερης ποιότητας legend για εικόνες, που με τη σειρά της βοηθά στην εκπαίδευση πιο ακριβών μοντέλων εικόνας-κειμένου. Αυτό επιτυγχάνεται μέσω ενός robust image captioner που παράγει λεπτομερείς και ακριβείς περιγραφές εικόνων. Με την εκπαίδευση στα βελτιωμένα legend, το DALL-E 3 έχει επιτύχει αξιοσημείωτα αποτελέσματα, που μοιάζουν πολύ με φωτογραφίες και έργα τέχνης που παράγονται από ανθρώπους.

Εκπαίδευση σε Συνθετικά Δεδομένα

Η концепτός της εκπαίδευσης σε συνθετικά δεδομένα δεν είναι καινούρια. Ωστόσο, η μοναδική συνεισφορά εδώ είναι η δημιουργία ενός καινούριου, περιγραφικού συστήματος legend εικόνων. Η επίδραση της χρήσης συνθετικών legend για την εκπαίδευση γεννητικών μοντέλων έχει sido σημαντική, οδηγώντας σε βελτιώσεις της ικανότητας του μοντέλου να ακολουθήσει πρότασεις ακριβώς.

Αξιολόγηση του DALL-E 3

Μέσω πολλών αξιολογήσεων και συγκρίσεων με προηγούμενα μοντέλα όπως το DALL-E 2 και το Stable Diffusion XL, το DALL-E 3 έχει δείξει ανώτερη απόδοση, ιδιαίτερα σε εργασίες που σχετίζονται με την ακολουθία πρότασης.

Σύγκριση μοντέλων εικόνας-κειμένου σε διάφορες αξιολογήσεις

Σύγκριση μοντέλων εικόνας-κειμένου σε διάφορες αξιολογήσεις

Η χρήση αυτοματοποιημένων αξιολογήσεων και βεντσών έχει παρέχει σαφή απόδειξη των ικανοτήτων του, στερεώνοντας τη θέση του ως state-of-the-art γεννητικού μοντέλου εικόνας-κειμένου.

Πρότασης και Ικανότητες του DALL-E 3

Το DALL-E 3 προσφέρει μια πιο λογική και εξευγενισμένη προσέγγιση στη δημιουργία οπτικών. Όσο σκρολάρετε, θα παρατηρήσετε πώς το DALL-E δημιουργεί κάθε εικόνα, με μια смесь ακρίβειας και φαντασίας που ανταποκρίνεται στην πρόταση που δίνεται.

Σε αντίθεση με τον προκάτοχό του, αυτή η αναβαθμισμένη έκδοση excels στην διάταξη αντικειμένων φυσικά μέσα σε μια σκηνή και στην απεικόνιση ανθρώπινων χαρακτηριστικών ακριβώς, μέχρι και τον σωστό αριθμό δακτυλίων σε ένα χέρι. Οι βελτιώσεις επεκτείνονται σε λεπτομέρειες και είναι τώρα διαθέσιμες σε υψηλότερη ανάλυση, εξασφαλίζοντας μια πιο πραγματική και επαγγελματική έξοδο.

Οι ικανότητες απόδοσης κειμένου έχουν επίσης δει σημαντικές βελτιώσεις. Όπου οι προηγούμενες εκδόσεις του DALL-E παρήγαγαν ακαταλήπτο κείμενο, το DALL-E 3 μπορεί τώρα να δημιουργήσει αναγνώσιμο και επαγγελματικά στυλιζαρισμένο κείμενο (μερικές φορές), και ακόμη και καθαρά λογότυπα σε περιπτώσεις.

Η κατανόηση του μοντέλου για σύνθετες και νюανσικές αιτήσεις εικόνων έχει βελτιωθεί σημαντικά. Το DALL-E 3 μπορεί τώρα να ακολουθήσει λεπτομερείς περιγραφές, ακόμη και σε σενάρια με πολλά στοιχεία και συγκεκριμένες οδηγίες, αποδεικνύοντας την ικανότητά του να παράγει συνεκτικές και καλοσυντηρημένες εικόνες. Ας εξερευνήσουμε κάποιες πρότασης και τις αντίστοιχες εξόδους που πήραμε:

Σχεδιάστε την συσκευασία για μια σειρά οργανικών τσαγιών. Περιλαμβάνετε χώρο για το όνομα του προϊόντος και την περιγραφή.

Εικόνες DALL-E 3 βασισμένες σε πρότασης κειμένου

Εικόνες DALL-E 3 βασισμένες σε πρότασης κειμένου (Σημείωση: το αριστερό πόστερ έχει λάθος ορθογραφία)

Δημιουργήστε μια ιστοσελίδα banner που διαφήμιζε μια καλοκαιρινή πώληση εξοπλισμού εξωτερικού χώρου. Η εικόνα να περιλαμβάνει μια παραλία με διάφορα κομμάτια εξοπλισμού εξωτερικού χώρου και κείμενο που ανακοινώνει 'Τεράστια Καλοκαιρινά Αποταγματα!'

Εικόνες DALL-E 3 βασισμένες σε πρότασης κειμένου

Εικόνες DALL-E 3 βασισμένες σε πρότασης κειμένου

Μια παλιά ταξιδιωτική αφίσα του Παρισιού με τολμηρό και στυλιζαρισμένο κείμενο που λέει 'Επισκεφθείτε το Παρίσι' στο κάτω μέρος.

Εικόνες DALL-E 3 βασισμένες σε πρότασης κειμένου

Εικόνες DALL-E 3 βασισμένες σε πρότασης κειμένου (Σημείωση: και τα δύο πόστερ έχουν λάθος ορθογραφία)

Γεννήστε μια εικόνα μιας πολυσύχναστης σκηνής του φεστιβάλ Diwali στην Ινδία, με οικογένειες που ανάβουν λάμπες, πυροτεχνήματα στον ουρανό και παραδοσιακά γλυκά και διακοσμήσεις.
Εικόνες DALL-E 3 βασισμένες σε πρότασης κειμένου

Εικόνες DALL-E 3 βασισμένες σε πρότασης κειμένου

Δημιουργήστε μια λεπτομερή αγορά στην αρχαία Ρώμη, με ανθρώπους με ενδυμασία της εποχής, διάφορα προϊόντα προς πώληση και αρχιτεκτονική της εποχής.
Εικόνες DALL-E 3 βασισμένες σε πρότασης κειμένου

Εικόνες DALL-E 3 βασισμένες σε πρότασης κειμένου

Γεννήστε μια εικόνα ενός διάσημου ιστορικού προσώπου, όπως η Κλεοπάτρα ή ο Λεονάρντο Ντα Βίντσι, τοποθετημένο σε一个 σύγχρονο περιβάλλον, χρησιμοποιώντας σύγχρονη τεχνολογία όπως κινητά τηλέφωνα ή laptop.
Εικόνες DALL-E 3 βασισμένες σε πρότασης κειμένου

Εικόνες DALL-E 3 βασισμένες σε πρότασης κειμένου

Περιορισμοί και Κίνδυνοι του DALL-E 3

Η OpenAI έχει λάβει σημαντικά βήματα για να φιλτράρει το εκPLICIT περιεχόμενο από τα δεδομένα εκπαίδευσης του DALL-E 3, με στόχο να μειώσει τις προκαταλήψεις και να βελτιώσει την έξοδο του μοντέλου. Αυτό περιλαμβάνει την εφαρμογή συγκεκριμένων φίλτρων για ευαίσθητες κατηγορίες περιεχομένου και την αναθεώρηση των ορίων για ευρύτερα φίλτρα. Το στάδιο της μετριάσεως περιλαμβάνει επίσης πολλά στρώματα προστασίας, όπως μηχανισμοί άρνησης στο ChatGPT για ευαίσθητα θέματα, ταξινομητές εισόδου πρότασης για να αποτρέψουν παραβιάσεις πολιτικής, λίστες αποκλεισμού για συγκεκριμένες κατηγορίες περιεχομένου και μετασχηματισμοί για να διασφαλίσουν ότι οι πρότασης συμμορφώνονται με τις οδηγίες.

Παρά τις προόδους, το DALL-E 3 έχει περιορισμούς στην κατανόηση χωρικών σχέσεων, στην απόδοση μακρού κειμένου ακριβώς και στη δημιουργία συγκεκριμένων εικόνων. Η OpenAI αναγνωρίζει αυτές τις προκλήσεις και εργάζεται για βελτιώσεις σε μελλοντικές εκδόσεις.

Η εταιρεία εργάζεται επίσης για τρόπους να διαφοροποιήσει τις εικόνες που παράγονται από το AI από αυτές που δημιουργούνται από ανθρώπους, αντανακλώντας την δέσμευσή τους για διαφάνεια και υπεύθυνη χρήση του AI.

DALL·E

DALL·E 3

Το DALL-E 3, η τελευταία έκδοση, θα είναι διαθέσιμο σε φάσεις, ξεκινώντας με συγκεκριμένες ομάδες πελατών και αργότερα επεκτείνοντας σε ερευνητικά εργαστήρια και υπηρεσίες API. Ωστόσο, μια ημερομηνία για δημόσια κυκλοφορία δεν έχει επιβεβαιωθεί ακόμη.

Η OpenAI θέτει ένα νέο πρότυπο στο πεδίο της τεχνητής νοημοσύνης με το DALL-E 3, συνδυάζοντας ομαλά σύνθετες τεχνικές ικανότητες και φιλικές προς τον χρήστη διεπαφές. Η ενσωμάτωση του DALL-E 3 σε ευρέως χρησιμοποιούμενες πλατφόρμες όπως το Bing αντανακλά μια μετατόπιση από εξειδικευμένες εφαρμογές σε ευρύτερες, πιο προσιτές μορφές ψυχαγωγίας και χρησιμότητας.

Ο πραγματικός game-changer στα επόμενα χρόνια θα είναι η ισορροπία μεταξύ καινοτομίας και ενδυνάμωσης του χρήστη. Οι εταιρείες που θα ευδοκιμήσουν θα είναι αυτές που δεν μόνο推ουν τα όρια του τι μπορεί να επιτύχει το AI, αλλά επίσης παρέχουν στους χρήστες την αυτονομία και τον έλεγχο που επιθυμούν. Η OpenAI, με την δέσμευσή της για την ηθική του AI, διανύει αυτόν τον δρόμο προσεκτικά. Ο στόχος είναι σαφής: να δημιουργήσει εργαλεία AI που δεν είναι μόνο ισχυρά, αλλά και αξιόπιστα και προσιτά, εξασφαλίζοντας ότι τα οφέλη του AI είναι προσιτά σε όλους.

Έχω περάσει τα τελευταία πέντε χρόνια βυθισμένος στον συναρπαστικό κόσμο της Μηχανικής Μάθησης και του Βαθιάς Μάθησης. Η δέσμευσή μου και η εξειδίκευσή μου με οδήγησαν να συμβάλλω σε πάνω από 50 διαφορετικά projects μηχανικής λογισμικού, με ιδιαίτερη έμφαση στο AI/ML. Η συνεχής περιέργειά μου με έχει οδηγήσει επίσης προς την Επεξεργασία Φυσικής Γλώσσας, ένα πεδίο που είμαι πρόθυμος να εξερευνήσω περαιτέρω.