Βασικές αρχές της AI

Τι είναι τα RNNs και LSTMs στη Βαθιά Μάθηση;

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Πολλές από τις πιο εντυπωσιακές προόδους στην επεξεργασία φυσικής γλώσσας και τους chatbots του AI οφείλονται στα Δικτυακά Νευρωνικά Δίκτυα (RNNs) και στα Δίκτυα Μνήμης Βραχύ και Μακρό Терміνα (LSTM). Τα RNNs και LSTMs είναι ειδικές αρχιτεκτονικές νευρωνικών δικτύων που μπορούν να επεξεργαστούν σειριακά δεδομένα, δεδομένα όπου η χρονολογική διάταξη έχει σημασία. Τα LSTMs είναι ουσιαστικά βελτιωμένες εκδοχές των RNNs, ικανές να ερμηνεύουν μεγαλύτερες ακολουθίες δεδομένων. Ας δούμε πώς είναι δομημένα τα RNNs και LSTMs και πώς επιτρέπουν τη δημιουργία πολύπλοκων συστημάτων επεξεργασίας φυσικής γλώσσας.

Τι είναι τα Δικτυακά Νευρωνικά Δίκτυα Προώθησης;

Πριν μιλήσουμε για το πώς λειτουργούν τα Δίκτυα Μνήμης Βραχύ και Μακρό Терміνα (LSTM) και τα Δίκτυα Συμβολής (CNN), πρέπει να συζητήσουμε τη μορφή ενός νευρωνικού δικτύου γενικά.

Ένα νευρωνικό δίκτυο έχει ως στόχο να εξετάσει δεδομένα και να μάθει σχετικές προτύπους, ώστε αυτά τα προτύπους να μπορούν να εφαρμοστούν σε άλλα δεδομένα και νέα δεδομένα να ταξινομηθούν. Τα νευρωνικά δίκτυα χωρίζονται σε τρεις ενότητες: το επίπεδο εισόδου, το κρυφό επίπεδο (ή πολλαπλά κρυφά επιπέδα) και το επίπεδο εξόδου.

Το επίπεδο εισόδου είναι αυτό που λαμβάνει τα δεδομένα στο νευρωνικό δίκτυο, ενώ τα κρυφά επιπέδα είναι αυτά που μαθαίνουν τα προτύπωση στα δεδομένα. Τα κρυφά επιπέδα στο σύνολο είναι συνδεδεμένα με το επίπεδο εισόδου και εξόδου μέσω “βαρών” και “偏ές” που είναι απλές υποθέσεις για το πώς τα δεδομένα σχετίζονται μεταξύ τους. Αυτά τα βάρη προσαρμόζονται κατά τη διάρκεια της εκπαίδευσης. Όσο το δίκτυο εκπαιδεύεται, οι υποθέσεις του μοντέλου για τα δεδομένα εκπαίδευσης (οι τιμές εξόδου) συγκρίνονται με τις πραγματικές ετικέτες εκπαίδευσης. Κατά τη διάρκεια της εκπαίδευσης, το δίκτυο πρέπει (ελπίζοντας) να γίνει πιο ακριβές στην πρόβλεψη σχέσεων μεταξύ δεδομένων, ώστε να μπορεί να ταξινομήσει ακριβώς νέα δεδομένα. Τα βαθιά νευρωνικά δίκτυα είναι δίκτυα που έχουν περισσότερα επιπέδα στο μέσο/περισσότερα κρυφά επιπέδα. Όσο περισσότερα κρυφά επιπέδα και κόμβοι έχει το μοντέλο, τόσο καλύτερα μπορεί να αναγνωρίσει προτύπωση στα δεδομένα.

Τα κανονικά, προωθητικά νευρωνικά δίκτυα, όπως αυτά που περιέγραψα παραπάνω, ονομάζονται συχνά “πυκνά νευρωνικά δίκτυα”. Αυτά τα πυκνά νευρωνικά δίκτυα συνδυάζονται με διαφορετικές αρχιτεκτονικές δικτύων που ειδικεύονται στην ερμηνεία διαφορετικών τύπων δεδομένων.

Τι είναι τα RNNs (Δικτυακά Νευρωνικά Δίκτυα Αναδρομής);

Τα Δικτυακά Νευρωνικά Δίκτυα Αναδρομής (RNNs) λαμβάνουν την γενική αρχή των προωθητικών νευρωνικών δικτύων και τα ermögουν να χειριστούν σειριακά δεδομένα δίνοντας στο μοντέλο μια εσωτερική μνήμη. Το “Αναδρομής” μέρος του ονόματος RNN προέρχεται από το γεγονός ότι η είσοδος και η έξοδος του δικτύου形成 μια βρόχο. Μόλις η έξοδος του δικτύου παραχθεί, η έξοδος αντιγράφεται και επιστρέφεται στο δίκτυο ως είσοδος. Όταν λαμβάνεται μια απόφαση, όχι μόνο η τρέχουσα είσοδος και έξοδος αναλύονται, αλλά και η προηγούμενη είσοδος λαμβάνεται υπόψη. Για να το πούμε με άλλη τρόπο, αν η αρχική είσοδος για το δίκτυο είναι X και η έξοδος είναι H, και H και X1 (η επόμενη είσοδος στη σειρά δεδομένων) τροφοδοτούνται στο δίκτυο για την επόμενη γύρο μάθησης. Με αυτόν τον τρόπο, ο контекst των δεδομένων (οι προηγούμενες εισόδους) διατηρείται καθώς το δίκτυο εκπαιδεύεται.

Το αποτέλεσμα αυτής της αρχιτεκτονικής είναι ότι τα RNNs είναι ικανά να χειριστούν σειριακά δεδομένα. Ωστόσο, τα RNNs πάσχουν από κάποια προβλήματα. Τα RNNs πάσχουν από το πρόβλημα της εξαφανιζόμενης και της εκρηκτικής κλίσης.

Το μήκος των ακολουθιών που ένα RNN μπορεί να ερμηνεύσει είναι khá περιορισμένο, ιδιαίτερα σε σύγκριση με τα LSTMs.

Τι είναι τα LSTMs (Δίκτυα Μνήμης Βραχύ και Μακρό Терміνα);

Τα Δίκτυα Μνήμης Βραχύ και Μακρό Терміνα (LSTMs) μπορούν να θεωρηθούν ως επεκτάσεις των RNNs, εφαρμόζοντας την концепτού της διατήρησης του контекστ των εισόδων. Ωστόσο, τα LSTMs έχουν τροποποιηθεί με beberapa σημαντικούς τρόπους που τους επιτρέπουν να ερμηνεύουν προηγούμενα δεδομένα με καλύτερους τρόπους. Οι αλλαγές που έγιναν στα LSTMs ασχολούνται με το πρόβλημα της εξαφανιζόμενης κλίσης και επιτρέπουν στα LSTMs να λαμβάνουν υπόψη πολύ μεγαλύτερες ακολουθίες εισόδων.

Τα μοντέλα LSTMs αποτελούνται από τρία διαφορετικά συστατικά, ή πύλες. Υπάρχει μια πύλη εισόδου, μια πύλη εξόδου και μια πύλη λήθης. Όπως και τα RNNs, τα LSTMs λαμβάνουν υπόψη τις εισόδους από το προηγούμενο βήμα όταν τροποποιούν τη μνήμη και τα βάρη εισόδου του μοντέλου. Η πύλη εισόδου λαμβάνει αποφάσεις για ποια τιμές είναι σημαντικές και πρέπει να επιτρέπονται να περάσουν από το μοντέλο. Eine σιγμοειδής συνάρτηση χρησιμοποιείται στην πύλη εισόδου, η οποία λαμβάνει αποφάσεις για ποια τιμές να περάσουν από το αναδρομικό δίκτυο. Το 0 απενεργοποιεί την τιμή, ενώ το 1 τη διατηρεί. Eine συνάρτηση TanH χρησιμοποιείται επίσης εδώ, η οποία αποφασίζει πόσο σημαντικές είναι οι τιμές εισόδου για το μοντέλο, κυμαίνονται από -1 έως 1.

Μετά τη λήψη υπόψη των τρεχουσών εισόδων και της μνήμης, η πύλη εξόδου αποφασίζει ποια τιμές να μεταφέρει στο επόμενο βήμα. Στην πύλη εξόδου, οι τιμές αναλύονται και ανατίθενται μια σημασία που κυμαίνεται από -1 έως 1. Αυτό ρυθμίζει τα δεδομένα πριν αυτά μεταφερθούν στην επόμενη χρονοσειρά. Τέλος, η δουλειά της πύλης λήθης είναι να απορρίψει πληροφορίες που το μοντέλο θεωρεί άσχετες για να λάβει μια απόφαση για τη φύση των τιμών εισόδου. Η πύλη λήθης χρησιμοποιεί μια σιγμοειδής συνάρτηση στις τιμές, εξόδοντας αριθμούς μεταξύ 0 (ξεχάστε αυτή) και 1 (διατηρήστε αυτή).

Ένα νευρωνικό δίκτυο LSTMs αποτελείται από ειδικά στρώματα LSTMs που μπορούν να ερμηνεύσουν σειριακά δεδομένα και τα πυκνά συνδεμένα στρώματα όπως αυτά που περιγράφηκαν παραπάνω. Μόλις τα δεδομένα περάσουν από τα στρώματα LSTMs, προχωρούν στα πυκνά συνδεμένα στρώματα.

Blogger και προγραμματιστής με ειδικότητες στα Machine Learning και Deep Learning θέματα. Ο Daniel ελπίζει να βοηθήσει τους άλλους να χρησιμοποιήσουν τη δύναμη του AI για κοινωνικό καλό.