Μοντέλα και πλατφόρμες AI

DIAMOND: Η διάχυση ως μοντέλο του περιβάλλοντος των ονείρων

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Το 2018, η ιδέα της ενίσχυσης της μάθησης σε νευρωνικά δίκτυα μοντέλων του κόσμου εισήχθη για πρώτη φορά και σύντομα εφαρμόστηκε σε μοντέλα του κόσμου. Κάποια από τα εξέχοντα μοντέλα που εφαρμόζουν την ενίσχυση της μάθησης ήταν το πλαίσιο Dreamer, το οποίο εισήγαγε την ενίσχυση της μάθησης από τον λατινικό χώρο ενός αναδρομικού μοντέλου του χώρου. Το DreamerV2 απέδειξε ότι η χρήση διακριτών λατινικών μπορεί να οδηγήσει σε μειωμένα λάθη συσσώρευσης και το πλαίσιο DreamerV3 ήταν σε θέση να επιτύχει ανθρώπινη απόδοση σε μια σειρά από εργασίες σε διάφορους τομείς με σταθερά υπερπαράμετρα.

Επιπλέον, можно να τραβήξουν παραλληλίες μεταξύ μοντέλων γεννήσεων εικόνων και μοντέλων του κόσμου, υποδεικνύοντας ότι η πρόοδος που έχει γίνει στα μοντέλα γεννήσεων εικόνων μπορεί να αναπαραχθεί για να ωφελήσει τα μοντέλα του κόσμου. Από τότε που η χρήση των μετασχηματιστών σε πλαισιάκια επεξεργασίας φυσικής γλώσσας κέρδισε δημοτικότητα, τα πλαισιάκια DALL-E και VQGAN εμφανίστηκαν. Τα πλαισιάκια αυτά εφαρμόζουν διακριτούς αυτο-κωδικοποιητές για να μετατρέψουν εικόνες σε διακριτά σύμβολα και ήταν σε θέση να δημιουργήσουν εξαιρετικά ισχυρά και αποτελεσματικά μοντέλα γεννήσεων κειμένου-εικόνας, αξιοποιώντας τις ικανότητες μοντελοποίησης ακολουθιών των αυτο-αναδρομικών μετασχηματιστών. Ταυτόχρονα, τα μοντέλα διάχυσης κέρδισαν έλξη και σήμερα, τα μοντέλα διάχυσης έχουν καθιερωθεί ως κυρίαρχο παράδειγμα για τη γεννήση εικόνων υψηλής ανάλυσης. Λόγω των ικανοτήτων που προσφέρουν τα μοντέλα διάχυσης και η ενίσχυση της μάθησης, γίνονται προσπάθειες να συνδυάσουν τις δύο προσεγγίσεις, με στόχο να επωφεληθούν από την ευελιξία των μοντέλων διάχυσης ως μοντέλων τροχιών, μοντέλων ανταμοιβής, σχεδιαστών και ως πολιτικής για την αυξανόμενη επέκταση των δεδομένων σε离 線ενίσχυση της μάθησης.

Τα μοντέλα του κόσμου προσφέρουν μια υποσχόμενη μέθοδο για την εκπαίδευση των πρακτόρων της ενίσχυσης της μάθησης με ασφάλεια και αποτελεσματικότητα. Παραδοσιακά, αυτά τα μοντέλα χρησιμοποιούν ακολουθίες διακριτών λατινικών μεταβλητών για να προσομοιώσουν τη δυναμική του περιβάλλοντος. Ωστόσο, αυτή η συμπίεση μπορεί να παραβλέψει τις οπτικές λεπτομέρειες που είναι κρίσιμες για την ενίσχυση της μάθησης. Ταυτόχρονα, τα μοντέλα διάχυσης έχουν αυξηθεί σε δημοτικότητα για τη γεννήση εικόνων, προκαλώντας τις παραδοσιακές μεθόδους που χρησιμοποιούν διακριτά λατινικά. Εμπνευσμένοι από αυτή τη μετατόπιση, σε αυτό το άρθρο, θα μιλήσουμε για το DIAMOND (DIffusion As a Model Of eNvironment Dreams), έναν πρακτικό της ενίσχυσης της μάθησης που εκπαιδεύεται μέσα σε ένα μοντέλο διάχυσης του κόσμου. Θα εξετάσουμε τις απαραίτητες επιλογές σχεδιασμού για να κάνουμε τη διάχυση κατάλληλη για το μοντέλο του κόσμου και θα δείξουμε ότι οι βελτιωμένες οπτικές λεπτομέρειες οδηγούν σε καλύτερη απόδοση του πρακτικού. Το DIAMOND θέτει einen νέο ορόσημο με μέσο ανθρώπινο κανονικοποιημένο σκορ 1,46 στο ανταγωνιστικό τεστ Atari 100k, το υψηλότερο για πρακτικούς που εκπαιδεύονται εξ ολοκλήρου μέσα σε ένα μοντέλο του κόσμου.

DIAMOND: Η διάχυση ως μοντέλο του περιβάλλοντος των ονείρων

Τα μοντέλα του κόσμου ή τα γεννητικά μοντέλα του περιβάλλοντος εμφανίζονται ως ένα από τα πιο σημαντικά στοιχεία για τους πρακτικούς να σχεδιάσουν και να σκεφτούν για το περιβάλλον τους. Αν και η χρήση της ενίσχυσης της μάθησης έχει επιτύχει σημαντική επιτυχία τα τελευταία χρόνια, τα μοντέλα που εφαρμόζουν την ενίσχυση της μάθησης είναι γνωστά για την ανεπάρκεια δειγματοληψίας, που τους περιορίζει σημαντικά στις πραγματικές εφαρμογές. Από την άλλη πλευρά, τα μοντέλα του κόσμου έχουν δείξει την ικανότητά τους να εκπαιδεύουν τους πρακτικούς της ενίσχυσης της μάθησης σε διάφορα περιβάλλοντα με σημαντικά βελτιωμένη δειγματοληψία, επιτρέποντας στο μοντέλο να μάθει από τις πραγματικές εμπειρίες. Τα πρόσφατα πλαισιάκια μοντέλων του κόσμου συνήθως μοντελοποιούν τη δυναμική του περιβάλλοντος ως μια ακολουθία διακριτών λατινικών μεταβλητών, με το μοντέλο να διακριτίζει τον λατινικό χώρο για να αποφύγει τα λάθη συσσώρευσης σε πολλαπλά χρονικά ορίζοντα. Αν και η προσέγγιση μπορεί να οδηγήσει σε σημαντικά αποτελέσματα, είναι επίσης συνδεδεμένη με απώλεια πληροφοριών, οδηγώντας σε απώλεια ποιότητας ανακατασκευής και απώλεια γενικότητας. Η απώλεια πληροφοριών μπορεί να γίνει ένα σημαντικό εμπόδιο για τις πραγματικές εφαρμογές που απαιτούν τις πληροφορίες να είναι καλά καθορισμένες, όπως η εκπαίδευση των αυτονομικών οχημάτων. Σε τέτοιες εργασίες, μικρές αλλαγές ή λεπτομέρειες στις οπτικές εισόδους, όπως το χρώμα του φαναρίου, ή το σήμα στροφής του οχήματος μπροστά, μπορεί να αλλάξουν την πολιτική του πρακτικού. Αν και η αύξηση του αριθμού των διακριτών λατινικών μπορεί να βοηθήσει στην αποφυγή απώλειας πληροφοριών, αυξάνει σημαντικά το κόστος υπολογισμού.

Επιπλέον, τα τελευταία χρόνια, τα μοντέλα διάχυσης έχουν εμφανιστεί ως η κυρίαρχη προσέγγιση για τη γεννήση εικόνων υψηλής ποιότητας,既然 τα πλαισιάκια που βασίζονται σε μοντέλα διάχυσης μαθαίνουν να αντιστρέφουν τη διαδικασία θορύβου και να ανταγωνίζονται μερικά από τα πιο καθιερωμένα πλαισιάκια που μοντελοποιούν διακριτά σύμβολα, και因此 προσφέρουν μια υποσχόμενη εναλλακτική λύση για την εξάλειψη της ανάγκης για διακριτοποίηση στο μοντέλο του κόσμου. Τα μοντέλα διάχυσης είναι γνωστά για την ικανότητά τους να είναι εύκολα συνδεδεμένα και να μοντελοποιούν複雑ες, πολλαπλές κατανομές χωρίς κατάρρευση τρόπων. Αυτά τα χαρακτηριστικά είναι κρίσιμα για το μοντέλο του κόσμου, поскольку η συνδεσιμότητα επιτρέπει στο μοντέλο του κόσμου να αντανακλά με ακρίβεια τις ενέργειες του πρακτικού, οδηγώντας σε πιο αξιόπιστες αναθέσεις πίστης. Επιπλέον, η μοντελοποίηση πολλαπλών κατανομών προσφέρει μεγαλύτερη ποικιλία σεναρίων εκπαίδευσης για τον πρακτικό, βελτιώνοντας την συνολική του απόδοση.

Χτίζοντας πάνω σε αυτά τα χαρακτηριστικά, το DIAMOND, (DIffusion As a Model Of eNvironment Dreams), ένας πρακτικός της ενίσχυσης της μάθησης που εκπαιδεύεται μέσα σε ένα μοντέλο διάχυσης του κόσμου. Το πλαίσιο DIAMOND κάνει προσεκτικές επιλογές σχεδιασμού για να διατηρήσει το μοντέλο διάχυσης του κόσμου αποτελεσματικό και σταθερό σε μακρούς χρονικούς ορίζοντες. Το πλαίσιο παρέχει μια ποιοτική ανάλυση για να δείξει την_importance αυτών των επιλογών σχεδιασμού. Το DIAMOND θέτει einen νέο ορόσημο με μέσο ανθρώπινο κανονικοποιημένο σκορ 1,46 στο ανταγωνιστικό τεστ Atari 100k, το υψηλότερο για πρακτικούς που εκπαιδεύονται εξ ολοκλήρου μέσα σε ένα μοντέλο του κόσμου. Η λειτουργία στο χώρο εικόνας επιτρέπει στο μοντέλο διάχυσης του DIAMOND να αντικαταστήσει ομαλά το περιβάλλον, προσφέροντας μεγαλύτερες εικόνες για το μοντέλο του κόσμου και την απόδοση του πρακτικού. Ιδιαίτερα, η βελτιωμένη απόδοση σε ορισμένα παιχνίδια οφείλεται στην καλύτερη μοντελοποίηση των κρίσιμων οπτικών λεπτομερειών. Το DIAMOND μοντελοποιεί το περιβάλλον ως ένα τυπικό POMDP ή μερικώς παρατηρήσιμο Μαρκόβιο διαδικασία απόφασης με ένα σύνολο καταστάσεων, ένα σύνολο διακριτών ενεργειών και ένα σύνολο εικόνων παρατηρήσεων. Οι συναρτήσεις μεταβάσεων περιγράφουν τη δυναμική του περιβάλλοντος, και η συνάρτηση ανταμοιβής χαρτογραφεί τις μεταβάσεις σε σκαλαρικές ανταμοιβές.

DIAMOND: Μεθοδολογία και Αρχιτεκτονική

Στην καρδιά του, τα μοντέλα διάχυσης είναι μια κατηγορία γεννητικών μοντέλων που γεννούν ένα δείγμα αναστρέφοντας τη διαδικασία θορύβου, και εμπνέονται βαθιά από τη μη ισορροπία της θερμοδυναμικής. Το πλαίσιο DIAMOND θεωρεί μια διαδικασία διάχυσης που indeκνεται από μια συνεχή χρονική μεταβλητή με αντίστοιχες περιθώρια και συνθήκες ορίων με μια κατανοητή ακατέργαστη προκαταρκτική κατανομή. Επιπλέον, για να λάβουμε ένα γεννητικό μοντέλο, το οποίο χαρτογραφεί από θόρυβο σε δεδομένα, το πλαίσιο DIAMOND πρέπει να αντιστρέψει τη διαδικασία, με την αντιστροφή της διαδικασίας να είναι επίσης μια διαδικασία διάχυσης, που τρέχει ανάποδα στο χρόνο. Επιπλέον, σε οποιοδήποτε σημείο του χρόνου, δεν είναι εύκολο να εκτιμηθεί η συνάρτηση σκορ, поскольку το πλαίσιο DIAMOND δεν έχει πρόσβαση στη真ική συνάρτηση σκορ, και το μοντέλο υπερβαίνει αυτό το εμπόδιο εφαρμόζοντας ένα στόχο ταιριάσματος σκορ, μια προσέγγιση που διευκολύνει ένα πλαίσιο να εκπαιδεύσει ένα μοντέλο σκορ χωρίς να γνωρίζει τη βασική συνάρτηση σκορ. Το μοντέλο διάχυσης με βάση το σκορ παρέχει ένα αусловικό γεννητικό μοντέλο. Ωστόσο, ένα υπόусловο γεννητικό μοντέλο της δυναμικής του περιβάλλοντος απαιτείται για να υπηρετήσει ως μοντέλο του κόσμου, και για να υπηρετήσει αυτόν τον σκοπό, το πλαίσιο DIAMOND κοιτάζει την γενική περίπτωση της προσέγγισης POMDP, στην οποία το πλαίσιο μπορεί να χρησιμοποιήσει τις προηγούμενες παρατηρήσεις και ενέργειες για να προσεγγίσει την άγνωστη Μαρκόβια κατάσταση. Όπως φαίνεται στο Σχήμα 1, το πλαίσιο DIAMOND χρησιμοποιεί αυτή την ιστορία για να συνδεθεί με ένα μοντέλο διάχυσης, για να εκτιμήσει και να γεννήσει την επόμενη παρατήρηση απευθείας. Αν και το πλαίσιο DIAMOND μπορεί να καταφύγει σε οποιοδήποτε SDE ή ODE solver σε θεωρία, υπάρχει ένα εμπόδιο μεταξύ NFE ή Αριθμός Funktion Evaluations, και ποιότητας δειγμάτων που επηρεάζει σημαντικά το κόστος συλλογής του μοντέλου διάχυσης.

Χτίζοντας πάνω στις παραπάνω γνώσεις, ας δούμε τώρα την πρακτική υλοποίηση του πλαισίου DIAMOND ενός μοντέλου διάχυσης του κόσμου, συμπεριλαμβανομένων των συντελεστών διαρροής και διάχυσης που αντιστοιχούν σε μια συγκεκριμένη επιλογή προσέγγισης διάχυσης. Αντί να επιλέξουμε το DDPM, ένα φυσικά κατάλληλο υποψήφιο για την εργασία, το πλαίσιο DIAMOND χτίζει πάνω στη διατύπωση EDM, και θεωρεί ένα πυρήνα διατάραξης με μια πραγματική συνάρτηση της διάχυσης του χρόνου που ονομάζεται προγραμματισμένος χρονοπρογραμματισμός. Το πλαίσιο επιλέγει τους προκαταρκτικούς για να διατηρήσει την είσοδο και έξοδο διασπορά για οποιοδήποτε επίπεδο φωνής. Η εκπαίδευση του δικτύου συνδυάζει σήμα και θόρυβο προσαρμοστικά, ανάλογα με το επίπεδο υποβάθμισης, και όταν ο θόρυβος είναι χαμηλός, και ο στόχος γίνεται η διαφορά μεταξύ του καθαρού και του perturbed σήματος, δηλαδή ο προστεθειμένος ガウσιανός θόρυβος. Εύλογα, αυτό αποτρέπει το στόχο της εκπαίδευσης από το να γίνει εύκολος στη χαμηλή-θόρυβη περιοχή. Σε πρακτική, αυτό το στόχο είναι υψηλής διασποράς στα άκρα του προγραμματισμού θορύβου, οπότε το μοντέλο δείγματος το επίπεδο θορύβου από μια log-κανονική κατανομή που επιλέγεται εμπειρικά για να συνδυάσει την εκπαίδευση γύρω από τις μεσαίες περιοχές θορύβου. Το πλαίσιο DIAMOND χρησιμοποιεί ένα τυπικό U-Net 2D για το πεδίο διανύσματος, και διατηρεί một буφέρ των προηγούμενων παρατηρήσεων και ενεργειών που το πλαίσιο χρησιμοποιεί για να συνδεθεί. Το πλαίσιο DIAMOND συνδυάζει αυτές τις προηγούμενες παρατηρήσεις με την επόμενη θορυβώδη παρατήρηση, και τις εισόδους ενεργειών μέσω των προσαρμοστικών ομαδικών layer normalization στις残iaux του U-Net.

DIAMOND: Πειράματα και Αποτελέσματα

Για μια綜合τική αξιολόγηση, το πλαίσιο DIAMOND επιλέγει το τεστ Atari 100k. Το τεστ Atari 100k αποτελείται από 26 παιχνίδια που σχεδιάστηκαν για να δοκιμάσουν μια ευρεία γκάμα από ικανότητες του πρακτικού. Σε κάθε παιχνίδι, ένας πρακτικός έχει περιορισμό 100k ενεργειών στο περιβάλλον, που είναι περίπου ισοδύναμο με 2 ώρες ανθρώπινου παιχνιδιού, για να μάθει το παιχνίδι πριν από την αξιολόγηση. Για σύγκριση, οι ακαδημαϊκοί πρακτικοί του Atari συνήθως εκπαιδεύονται για 50 εκατομμύρια βήματα, που αντιπροσωπεύουν μια 500-πλάσια αύξηση της εμπειρίας. Εκπαιδεύσαμε το DIAMOND από την αρχή χρησιμοποιώντας 5 τυχαίες σπόρους για κάθε παιχνίδι. Κάθε εκπαιδευτική διαδικασία απαιτούσε περίπου 12GB VRAM και πήρε περίπου 2,9 ημέρες σε ένα seul Nvidia RTX 4090, που ανέρχεται σε 1,03 GPU χρόνια συνολικά. Ο παρακάτω πίνακας παρέχει το σκορ για όλα τα παιχνίδια, το μέσο, και το IQM ή interquartile μέσο των ανθρώπινων-κανονικοποιημένων σκορ.

Ακολουθώντας τις περιορισμούς των σημείων εκτιμώσεων, το πλαίσιο DIAMOND παρέχει στρατηγική bootstrap εμπιστοσύνη στο μέσο, και το IQM ή interquartile μέσο των ανθρώπινων-κανονικοποιημένων σκορ μαζί με προφίλ απόδοσης και επιπλέον μετρικών, όπως συνοψίζεται στο παρακάτω σχήμα.

Τα αποτελέσματα δείχνουν ότι το DIAMOND εκτελείται εξαιρετικά σε ολόκληρο το τεστ, υπερβαίνοντας τους ανθρώπινους παίκτες σε 11 παιχνίδια και επιτυγχάνοντας ένα υπεράνθρωπο μέσο HNS 1,46, θέτοντας einen νέο ορόσημο για πρακτικούς που εκπαιδεύονται εξ ολοκλήρου μέσα σε ένα μοντέλο του κόσμου. Επιπλέον, το IQM του DIAMOND είναι συγκρίσιμο με το STORM και υπερβαίνει όλα τα άλλα baseline. Το DIAMOND excels σε περιβάλλοντα όπου η захопηση μικρών λεπτομερειών είναι κρίσιμη, όπως Asterix, Breakout, και RoadRunner. Επιπλέον, όπως συζητήθηκε νωρίτερα, το πλαίσιο DIAMOND έχει την ευελιξία να εφαρμόζει οποιοδήποτε μοντέλο διάχυσης στη διαδικασία του, αν και επέλεξε την προσέγγιση EDM, θα ήταν μια φυσική επιλογή να εφαρμόσει το μοντέλο DDPM,既然 ήδη εφαρμόζεται σε πολλές εφαρμογές γεννήσεων εικόνων. Για να συγκρίνει την προσέγγιση EDM με την εφαρμογή DDPM, το πλαίσιο DIAMOND εκπαιδεύει και τις δύο παραλλαγές με την ίδια αρχιτεκτονική δικτύου σε ένα κοινό στατικό σύνολο δεδομένων με πάνω από 100k καρέ που συλλέχθηκαν με μια εμπειρική πολιτική. Ο αριθμός των βημάτων απο-θορύβωσης είναι άμεσα συνδεδεμένος με το κόστος συλλογής του μοντέλου του κόσμου, και έτσι λιγότερα βήματα θα μειώσουν το κόστος εκπαίδευσης ενός πρακτικού σε φανταστικές τροχιές. Για να διατηρήσουμε το μοντέλο του κόσμου μας να είναι υπολογιστικά συγκρίσιμο με άλλα baseline, όπως το IRIS που απαιτεί 16 NFE ανά βήμα, στοχεύουμε να χρησιμοποιήσουμε όχι περισσότερα από δέκα βήματα απο-θορύβωσης, προτιμότερα λιγότερα. Ωστόσο, η ρύθμιση του αριθμού των βημάτων απο-θορύβωσης πολύ χαμηλά μπορεί να μειώσει την ποιότητα εικόνας, οδηγώντας σε λάθη συσσώρευσης. Για να αξιολογήσουμε τη σταθερότητα των διαφορετικών παραλλαγών διάχυσης, εμφανίζουμε τις φανταστικές τροχιές που γεννιούνται αυτο-αναδρομικά μέχρι t = 1000 βήματα στο παρακάτω σχήμα, χρησιμοποιώντας διαφορετικά αριθμό βημάτων απο-θορύβωσης n ≤ 10.

Παρατηρούμε ότι η χρήση του DDPM (α), σε αυτή τη περιοχή οδηγεί σε σοβαρά λάθη συσσώρευσης, khiến το μοντέλο του κόσμου να εξαφανιστεί γρήγορα από την κατανομή. Αντίθετα, το μοντέλο διάχυσης του DIAMOND που βασίζεται στο EDM (β) παραμένει πολύ πιο σταθερό σε μακρούς χρονικούς ορίζοντες, ακόμη και με ένα μόνο βήμα απο-θορύβωσης. Οι φανταστικές τροχιές με μοντέλα διάχυσης του DIAMOND που βασίζονται στο DDPM (αριστερά) και στο EDM (δεξιά) εμφανίζονται. Η αρχική παρατήρηση στο t = 0 είναι η ίδια για cả τα δύο, και κάθε σειρά αντιστοιχεί σε一个 μειούμενο αριθμό βημάτων απο-θορύβωσης n. Παρατηρούμε ότι η γεννήση που βασίζεται στο DDPM υποφέρει από λάθη συσσώρευσης, με μικρότερο αριθμό βημάτων απο-θορύβωσης οδηγώντας σε ταχύτερη συσσώρευση λαθών. Αντίθετα, το μοντέλο διάχυσης του DIAMOND που βασίζεται στο EDM παραμένει πολύ πιο σταθερό, ακόμη και για n = 1. Η βέλτιστη προβλέψη για ένα βήμα είναι η προσδοκία των πιθανών ανακατασκευών για μια δεδομένη θορυβώδη είσοδο, η οποία μπορεί να είναι εκτός κατανομής αν η μεταγενέστερη κατανομή είναι πολλαπλή. Ενώ κάποια παιχνίδια, όπως το Breakout, έχουν детерμινιστικές μεταβάσεις που μπορούν να μοντελοποιηθούν ακριβώς με ένα μόνο βήμα απο-θορύβωσης, άλλα παιχνίδια εμφανίζουν μερική παρατηρησιμότητα, οδηγώντας σε πολλαπλές κατανομές παρατηρήσεων. Σε αυτές τις περιπτώσεις, ένας αναδρομικός solver είναι απαραίτητος για να οδηγήσει τη διαδικασία δειγμάτων προς einen συγκεκριμένο τρόπο, όπως φαίνεται στο παιχνίδι Boxing στο παρακάτω σχήμα. Συνεπώς, το πλαίσιο DIAMOND ορίζει n = 3 σε όλα τα πειράματά μας.

Το παραπάνω σχήμα συγκρίνει την προβλέψη για ένα βήμα (πάνω σειρά) και την προβλέψη για πολλά βήματα (κάτω σειρά) στο Boxing. Οι κινήσεις του μαύρου παίκτη είναι απρόβλεπτες, khiến την προβλέψη για ένα βήμα να interpolate μεταξύ των πιθανών αποτελεσμάτων, οδηγώντας σε θολές προβλέψεις. Αντίθετα, η προβλέψη για πολλά βήματα παράγει μια σαφή εικόνα, οδηγώντας τη γεννήση προς einen συγκεκριμένο τρόπο. Ιδιαίτερα,既然 η πολιτική ελέγχει τον λευκό παίκτη, οι ενέργειές του είναι γνωστές στο μοντέλο του κόσμου, εξαλείφοντας την αβεβαιότητα. Έτσι, και η προβλέψη για ένα βήμα και η προβλέψη για πολλά βήματα προβλέπουν σωστά τη θέση του λευκού παίκτη.

Στο παραπάνω σχήμα, οι τροχιές που φανταζόμαστε από το DIAMOND γενικά εμφανίζουν υψηλότερη ποιότητα εικόνας και είναι πιο πιστές στο πραγματικό περιβάλλον σε σύγκριση με αυτές που φανταζόμαστε από το IRIS. Οι τροχιές που γεννιούνται από το IRIS περιέχουν οπτικές ασυνέπειες μεταξύ των καρέ (υπογραμμισμένες από λευκές κουκκίδες), όπως εχθροί που εμφανίζονται ως ανταμοιβές και αντίστροφα. Αν και αυτές οι ασυνέπειες μπορεί να επηρεάσουν μόνο λίγους πίξελς, μπορούν να επηρεάσουν σημαντικά την εκμάθηση μιας βέλτιστης πολιτικής. Το σχήμα δείχνει συνεχόμενα καρέ που φανταζόμαστε από το IRIS (αριστερά) και το DIAMOND (δεξιά). Οι λευκές κουκκίδες υπογραμμίζουν τις ασυνέπειες μεταξύ των καρέ, οι οποίες εμφανίζονται μόνο στις τροχιές που γεννιούνται από το IRIS. Στο Asterix (πάνω σειρά), ένας εχθρός (πορτοκαλί) γίνεται ανταμοιβή (κόκκινη) στο δεύτερο καρέ, μετά επανέρχεται σε εχθρό στο τρίτο καρέ και πάλι σε ανταμοιβή στο τέταρτο καρέ. Στο Breakout (μεσαία σειρά), τα τούβλα και το σκορ είναι ασυνεπή μεταξύ των καρέ. Στο Road Runner (κάτω σειρά), οι ανταμοιβές (μικρά μπλε σημεία στο δρόμο) είναι ασυνεπείς μεταξύ των καρέ. Αυτές οι ασυνέπειες δεν εμφανίζονται στο DIAMOND. Στο Breakout, το σκορ ενημερώνεται αξιόπιστα με +7 όταν ένα κόκκινο τούβλο σπάει.

Συμπέρασμα

Σε αυτό το άρθρο, μιλήσαμε για το DIAMOND, έναν πρακτικό της ενίσχυσης της μάθησης που εκπαιδεύεται μέσα σε ένα μοντέλο διάχυσης του κόσμου. Το πλαίσιο DIAMOND κάνει προσεκτικές επιλογές σχεδιασμού για να διατηρήσει το μοντέλο διάχυσης του κόσμου αποτελεσματικό και σταθερό σε μακρούς χρονικούς ορίζοντες. Το πλαίσιο παρέχει μια ποιοτική ανάλυση για να δείξει την_importance αυτών των επιλογών σχεδιασμού. Το DIAMOND θέτει einen νέο ορόσημο με μέσο ανθρώπινο κανονικοποιημένο σκορ 1,46 στο ανταγωνιστικό τεστ Atari 100k, το υψηλότερο για πρακτικούς που εκπαιδεύονται εξ ολοκλήρου μέσα σε ένα μοντέλο του κόσμου. Η λειτουργία στο χώρο εικόνας επιτρέπει στο μοντέλο διάχυσης του DIAMOND να αντικαταστήσει ομαλά το περιβάλλον, προσφέροντας μεγαλύτερες εικόνες για το μοντέλο του κόσμου και την απόδοση του πρακτικού. Ιδιαίτερα, η βελτιωμένη απόδοση σε ορισμένα παιχνίδια οφείλεται στην καλύτερη μοντελοποίηση των κρίσιμων οπτικών λεπτομερειών. Το DIAMOND μοντελοποιεί το περιβάλλον ως ένα τυπικό POMDP ή μερικώς παρατηρήσιμο Μαρκόβιο διαδικασία απόφασης με ένα σύνολο καταστάσεων, ένα σύνολο διακριτών ενεργειών και ένα σύνολο εικόνων παρατηρήσεων. Οι συναρτήσεις μεταβάσεων περιγράφουν τη δυναμική του περιβάλλοντος, και η συνάρτηση ανταμοιβής χαρτογραφεί τις μεταβάσεις σε σκαλαρικές ανταμοιβές.

Ένας μηχανικός επάγγελμα, ένας συγγραφέας με την καρδιά. Ο Kunal είναι ένας τεχνικός συγγραφέας με einen βαθύ έρωτα και κατανόηση του AI και ML, αφιερωμένος στο να απλοποιεί σύνθετες έννοιες σε αυτά τα πεδία μέσω των ελκυστικών και ενημερωτικών εγγράφων του.