Μοντέλα και πλατφόρμες AI
SALMONN: Προσέγγιση για Γενικές Ικανότητες Ακρόασης σε Μεγάλους Γλωσσικούς Μοντέλους
Η ακρόαση, η οποία περιλαμβάνει την αντίληψη και κατανόηση γενικών ακουστικών πληροφοριών, είναι κρίσιμη για τους एजέντες AI σε πραγματικά περιβάλλοντα. Αυτές οι ακουστικές πληροφορίες περιλαμβάνουν τρεις основικές κατηγορίες ήχων: μουσική, ακουστικά γεγονότα και ομιλία. Πρόσφατα, τα κείμενο-基準 Büyük Γλωσσικά Μοντέλα (LLM) έχουν δείξει αξιοσημείωτες ικανότητες, επιτυγχάνοντας ανθρώπινου επιπέδου απόδοση σε eine ευρεία γκάμα φυσικής Γλωσσικής Επεξεργασίας (NLP) εργασιών. Επιπλέον, η εκπαίδευση οδηγιών, μια μέθοδος εκπαίδευσης που χρησιμοποιεί ζευγάρια αναφοράς απαντήσεων και προτροπών χρήστη, έχει γίνει δημοφιλής. Αυτή η προσέγγιση εκπαιδεύει τα μεγάλα γλωσσικά μοντέλα να ακολουθούν πιο αποτελεσματικά τις ανοικτές οδηγίες του χρήστη. Ωστόσο, η τρέχουσα έρευνα επικεντρώνεται ολοένα και περισσότερο στην ενίσχυση των μεγάλων γλωσσικών μοντέλων με την ικανότητα να αντιλαμβάνονται πολυτροπικά περιεχόμενα.
Επιδιώκοντας το ίδιο, σε αυτό το άρθρο, θα μιλήσουμε για το SALMONN ή Speech Audio Language Music Open Neural Network, ένα state-of-the-art ανοιχτό speech audio language music νευρωνικό δίκτυο που κατασκευάζεται με την ενσωμάτωση speech και audio encoders με ένα pre-εκπαιδευμένο κείμενο-基準 μεγάλο γλωσσικό μοντέλο σε ένα ενιαίο audio-text πολυτροπικό μοντέλο. Το μοντέλο SALMONN ermöglicht τα Μεγάλα Γλωσσικά Μοντέλα να κατανοούν και να επεξεργάζονται γενικές ακουστικές εισόδους απευθείας, και να παρέχουν ανταγωνιστική απόδοση σε eine ευρεία γκάμα ακουστικών και ομιλίας εργασιών που χρησιμοποιούνται στην εκπαίδευση, συμπεριλαμβανομένων ακουστικών πληροφοριών-基準 ερωτήσεων και απαντήσεων, ομιλίας αναγνώρισης και μετάφρασης, επιβεβαίωσης ομιλητή, αναγνώρισης συναισθήματος, ακουστικών και μουσικής legend, και πολλά άλλα. Θα κάνουμε μια πιο sâuτή εμβάθυνση στο πλαίσιο SALMONN, και θα εξετάσουμε την λειτουργία του, την αρχιτεκτονική, και τα αποτελέσματα σε eine ευρεία γκάμα NLP εργασιών. Έτσι, ας ξεκινήσουμε.
SALMONN: Εισαγωγή στα Μοντέλα Μεγάλων Γλωσσικών Μοντέλων με Μονό Ακουστικό-Κείμενο Πολυτροπικότητα
Το SALMONN αντιπροσωπεύει το Speech Audio Language Music Open Neural Network, και είναι ένα μονό audio-text πολυτροπικό μεγάλο γλωσσικό μοντέλο που μπορεί να αντιλαμβάνεται και να κατανοεί τρεις βασικές ακουστικές ή ήχους τύπους, συμπεριλαμβανομένων ομιλίας, ακουστικών γεγονότων, και μουσικής. Το μοντέλο SALMONN ermöglicht τα Μεγάλα Γλωσσικά Μοντέλα να κατανοούν και να επεξεργάζονται γενικές ακουστικές εισόδους απευθείας, και να παρέχουν ανταγωνιστική απόδοση σε eine ευρεία γκάμα ακουστικών και ομιλίας εργασιών.
Για να ενισχύσει την απόδοσή του σε ομιλία και μη ομιλία ακουστικά εργασίες, το πλαίσιο SALMONN χρησιμοποιεί μια διπλή encoder δομή που αποτελείται από einen BEATs audio encoder, και einen speech encoder που προέρχεται από το μοντέλο Whisper ομιλίας. Επιπλέον, το πλαίσιο SALMONN χρησιμοποιεί επίσης einen window-level Q-Former ή query Transformer ως σύνδεσμο για να μετατρέψει μια έξοδο ακολουθίας μεταβλητής μήκους encoder σε aumented ακουστικά tokens μεταβλητού αριθμού, και τελικά να επιτύχει υψηλή χρονική ανάλυση για audio-text συσχετίσεις. Η LoRA ή Low Rank Adaptation προσέγγιση χρησιμοποιείται ως cross-modal προσαρμογέας στο Vicuna πλαίσιο για να συσχετίσει τον χώρο εξόδου με τον aumented χώρο εισόδου σε μια προσπάθεια να ενισχύσει περαιτέρω την απόδοσή του. Στο πλαίσιο SALMONN, η ικανότητα να εκτελεί cross-modal εργασίες που δεν έχουν δει κατά την εκπαίδευση φάση χάνεται κατά την εκπαίδευση οδηγιών ως cross-modal emergent ικανότητες, η οποία είναι ο основικός λόγος για τον οποίο το πλαίσιο SALMONN εφαρμόζει μια επιπλέον few-shot activation φάση για να ανακτήσει τις γενικές emergent ικανότητες του LLM πλαισίου.
Επιπλέον, το πλαίσιο χρησιμοποιεί eine ευρεία γκάμα ακουστικών γεγονότων, μουσικής benchmarks, και ομιλίας benchmarks για να αξιολογήσει τις γνωστικές ακρόασης ικανότητές του, και διαιρεί τα benchmarks σε τρία επίπεδα. Στο πρώτο επίπεδο, το πλαίσιο εκπαιδεύει οκτώ εργασίες σε οδηγία εκπαίδευση, συμπεριλαμβανομένων μετάφρασης, ακουστικών legend, και ομιλίας αναγνώρισης. Τα άλλα δύο επίπεδα είναι ανεκπαιδευμένες εργασίες με το δεύτερο επίπεδο να αποτελείται από πέντε ομιλία-基準 NLP εργασίες όπως slot filling και μετάφραση σε ανεκπαιδευμένες γλώσσες που βασίζονται σε υψηλής ποιότητας πολυγλωσσικές συσχετίσεις μεταξύ κειμένου και ομιλίας tokens. Το τελικό επίπεδο εργασιών επιχειρεί να κατανοήσει ομιλία και μη ομιλία ακουστικές πληροφορίες για ομιλία-ακουστική συλλογιστική και ακουστική-基準 αφήγηση.
Για να συνοψίσουμε, το πλαίσιο SALMONN είναι
- Το πρώτο πολυτροπικό μεγάλο γλωσσικό μοντέλο που μπορεί να κατανοήσει και να αντιλαμβανθεί γενικές ακουστικές εισόδους, συμπεριλαμβανομένων ακουστικών γεγονότων, ομιλίας, και μουσικής, στο μέγιστο της ικανότητάς του.
- Μια προσπάθεια να αναλύσει cross-modal emergent ικανότητες που προσφέρονται με την εφαρμογή του LoRA scaling factor, και με την χρήση μιας επιπλέον budget-friendly activation φάσης κατά την εκπαίδευση για να ενεργοποιήσει cross-modal emergent ικανότητες του πλαισίου.
SALMONN: Αρχιτεκτονική και Μεθοδολογία
Σε αυτήν την ενότητα, θα εξετάσουμε την αρχιτεκτονική, τη μέθοδο εκπαίδευσης, και την πειραματική εγκατάσταση για το πλαίσιο SALMONN.
Αρχιτεκτονική Μοντέλου
Στην καρδιά της αρχιτεκτονικής του, το πλαίσιο SALMONN συγχρονίζει και συνδυάζει τις εξόδους από δύο ακουστικές encoders, και στη συνέχεια εφαρμόζει einen Q-Former στο επίπεδο πλαισίου ως σύνδεσμο. Η εξοδος ακολουθία που παράγεται από τον Q-Former συνδυάζεται με κείμενο οδηγία προτροπές και στη συνέχεια παρέχεται ως είσοδος στην προσέγγιση LoRA adaptation για να παράγει την απαιτούμενη απάντηση.
Ακουστικές Encoders
Το πλαίσιο SALMONN χρησιμοποιεί δύο ακουστικές encoders: einen non-speech BEATs audio encoder, και einen speech encoder που προέρχεται από το μοντέλο Whisper ομιλίας. Ο BEATs audio encoder έχει εκπαιδευτεί να χρησιμοποιεί την αυτο-επιβεβαιωμένη επαναληπτική μάθηση προσέγγιση για να εξαγάγει μη ομιλία υψηλού επιπέδου ακουστικές σημασιολογίες, ενώ ο speech encoder έχει εκπαιδευτεί σε eine μεγάλη ποσότητα αδύναμης επιβεβαιωμένης δεδομένων για ομιλία αναγνώριση και ομιλία μετάφραση εργασίες, με τα χαρακτηριστικά εξόδου του encoder να είναι κατάλληλα για να περιλαμβάνουν θόρυβο και ομιλία πληροφορίες. Το μοντέλο πρώτα tokenizes την είσοδο ακουστική, και στη συνέχεια την mask και την προβλέπει κατά την εκπαίδευση. Τα ακουστικά χαρακτηριστικά αυτών των δύο encoders συμπληρώνουν η μία την άλλη, και είναι κατάλληλα για ομιλία και μη ομιλία πληροφορίες.
Window Level Q-Former
Η εφαρμογή της δομής Q-Former είναι μια κοινή προσέγγιση που χρησιμοποιείται στα LLM πλαισια για να μετατρέψει την έξοδο ενός image encoder σε κείμενο εισόδου tokens, και κάποια τροποποίηση χρειάζεται όταν αντιμετωπίζουμε ακουστικά tokens μεταβλητού μήκους. Για να seja πιο συγκεκριμένος, το πλαίσιο θεωρεί την έξοδο encoder της εισόδου εικόνας ως μια συνδεδεμένη έξοδο encoder ακολουθία, και ο Q-Former αναπτύσσει einen σταθερό αριθμό εκπαιδεύσιμων ερωτημάτων για να μετατρέψει την έξοδο encoder ακολουθία σε κείμενο tokens χρησιμοποιώντας στοιβάζοντες Q-Former blocks. Ένας στοιβάζων Q-Former block μοιάζει με einen Transformer decoder block με τις εξαιρέσεις να αφαιρούν casual masks στις self-attention στρώσεις, και να χρησιμοποιούν einen σταθερό αριθμό εκπαιδεύσιμων στατικών ερωτημάτων στις αρχικές στρώσεις.
LoRA και LLM
Το πλαίσιο SALMONN επίσης αναπτύσσει einen Vicuna LLM, который είναι ένα LLaMA μεγάλο γλωσσικό μοντέλο που έχει fine-εκπαιδευτεί για να ακολουθήσει οδηγίες πιο ακριβώς, και αποτελεσματικά. Η LoRA προσέγγιση είναι μια κοινή μέθοδος που χρησιμοποιείται για parameter-эффективная fine-εκπαίδευση, και η ένταξή της στο πλαίσιο SALMONN για να αξιολογήσει βάρος πίνακες και να προσαρμόσει το ερώτημα στις self-attention στρώσεις.

Μέθοδος Εκπαίδευσης
Το πλαίσιο SALMONN χρησιμοποιεί μια τρι-στάδιο cross-modal εκπαίδευση προσέγγιση. Η εκπαίδευση φάση αποτελείται από eine pre-εκπαίδευση φάση, και eine οδηγία fine-εκπαίδευση φάση που περιλαμβάνονται σε meisten visual LLM πλαισια, και eine επιπλέον activation fine-εκπαίδευση φάση εφαρμόζεται για να επιλύσει over-fitting προβλήματα που συναντώνται κατά την ομιλία legend και ομιλία αναγνώριση εργασίες.
Pre-Εκπαίδευση Φάση
Για να περιοριστεί ο χάσμα που παρατηρείται μεταξύ pre-εκπαιδευμένων παραμέτρων, συμπεριλαμβανομένων encoders και LLM, και τυχαία αρχικοποιημένων παραμέτρων, συμπεριλαμβανομένων προσαρμογέων και σύνδεσμων, το πλαίσιο SALMONN χρησιμοποιεί eine μεγάλη ποσότητα ακουστικής legend και ομιλίας αναγνώρισης δεδομένων για να pre-εκπαιδεύσει τα LoRA και Q-Former components. Αυτές οι εργασίες περιέχουν κρίσιμες ακουστικές πληροφορίες για τα βασικά περιεχόμενα των ακουστικών γεγονότων, τόσο ομιλίας όσο και μη ομιλίας, και καμία από αυτές δεν απαιτεί σύνθετη κατανόηση ή συλλογιστική για να μάθει συσχετίσεις μεταξύ κειμένου και ακουστικών πληροφοριών.
Οδηγία Fine-Εκπαίδευση Φάση
Η οδηγία fine-εκπαίδευση φάση που εφαρμόζεται στο πλαίσιο SALMONN μοιάζει με αυτήν που εφαρμόζεται στα NLP και visual LLM πλαισια, χρησιμοποιώντας eine λίστα ακουστικών γεγονότων, μουσικής εργασιών και ομιλίας γεγονότων για να fine-εκπαιδεύσει ακουστική-κείμενο οδηγίες. Οι εργασίες έχουν προτεραιότητα με βάση την σημασία τους σε διάφορες δοκιμές, συμπεριλαμβανομένων phone αναγνώρισης, overlapping ομιλίας αναγνώρισης, και μουσικής legend. Επιπλέον, κείμενο πληροφορίες που ζευγαρώνουν με ακουστικά δεδομένα αποτελούν την βάση για τη δημιουργία οδηγία προτροπών.
Εργασία Over-Fitting
Ακόμη και όταν εφαρμόζεται μόνο οι δύο πρώτες εκπαίδευση φάσεις, το πλαίσιο SALMONN παρέχει ανταγωνιστική απόδοση σε οδηγία fine-εκπαίδευση εργασίες, αν και η απόδοση δεν είναι στο ίδιο επίπεδο όταν εκτελεί cross-modal εργασίες, ιδιαίτερα σε εργασίες που απαιτούν cross-modal συλλογιστική ικανότητες. Συγκεκριμένα, το μοντέλο偶asionally παραβιάζει οδηγία προτροπές που οδηγούν στη δημιουργία μη σχετικών ή λανθασμένων απαντήσεων, και αυτό το φαινόμενο ονομάζεται εργασία over-fitting στο πλαίσιο SALMONN, και η Activation Tuning φάση εφαρμόζεται για να επιλύσει αυτά τα over-fitting προβλήματα.
Activation Tuning Φάση
Μια αποτελεσματική προσέγγιση για να επιλύσει over-fitting προβλήματα είναι να κανονικοποιήσει intrinsic conditional γλωσσικά μοντέλα χρησιμοποιώντας μεγαλύτερες και πιο ποικίλες απαντήσεις, όπως αφήγηση ή ακουστική-πληροφορία-基準 ερωτήσεων και απαντήσεων. Το πλαίσιο στη συνέχεια δημιουργεί το ζευγάρι εκπαίδευση δεδομένων για αυτές τις εργασίες χρησιμοποιώντας κείμενο που ζευγαρώνει με ακουστική ή ομιλία ή μουσική legend.
Εργασία Προδιαγραφές
Για να αξιολογήσει τις zero-shot cross-modal emergent ικανότητες του SALMONN, οι développers έχουν περιλαμβάνει 15 ομιλία, ακουστική και μουσική εργασίες που διαιρούνται σε τρία επίπεδα.
Επίπεδο 1
Στο πρώτο επίπεδο, οι εργασίες χρησιμοποιούνται για οδηγία fine-εκπαίδευση, και επομένως, είναι η πιο εύκολη σειρά εργασιών που το πλαίσιο SALMONN πρέπει να εκτελέσει.
Επίπεδο 2
Το δεύτερο επίπεδο αποτελείται από ανεκπαιδευμένες εργασίες, και το επίπεδο δυσκολίας είναι υψηλότερο σε σύγκριση με το πρώτο επίπεδο. Στο δεύτερο επίπεδο, οι εργασίες είναι NLP-基準 εργασίες, συμπεριλαμβανομένων ομιλίας keyword εξαγωγή που χρησιμοποιείται για να αξιολογήσει την ακρίβεια του πλαισίου όταν εξάγει bestimmte λέξεις χρησιμοποιώντας ομιλία.
Επίπεδο 3
Η δυσκολία των εργασιών στο τρίτο επίπεδο είναι η μέγιστη σε σύγκριση με τα άλλα δύο επίπεδα, και περιλαμβάνει SAC ή Speech Audio Co-Reasoning, και Audio-基準 αφήγηση εργασίες. Η SAC εργασία απαιτεί το πλαίσιο SALMONN να κατανοήσει eine ερώτηση που περιλαμβάνεται στην ακουστική κλιπ που δίνεται στο μοντέλο, να βρει υποστηρικτικές αποδείξεις χρησιμοποιώντας ακουστικά γεγονότα ή μουσική στο υπόβαθρο, και τελικά να παράγει μια κατάλληλη αιτία για να απαντήσει στην ερώτηση. Η Audio-基準 αφήγηση εργασία απαιτεί το μοντέλο να παράγει eine σημαντική αφήγηση με βάση τις ακουστικές πληροφορίες που προέρχονται από γενικές ακουστικές εισόδους.

Αποτελέσματα
Επίπεδο 1 Εργασίες
Ο παρακάτω πίνακας δείχνει τα αποτελέσματα στις εργασίες του πρώτου επιπέδου, και όπως μπορείτε να δείτε, το πλαίσιο SALMONN παρέχει ανταγωνιστική απόδοση στις εργασίες του πρώτου επιπέδου με ή χωρίς activation-tuning.

Επίπεδο 2 και 3 Εργασίες
Αν και το πλαίσιο SALMONN παρέχει ανταγωνιστική απόδοση στις εργασίες του πρώτου επιπέδου ακόμη και χωρίς fine-εκπαίδευση, η ίδια δεν μπορεί να ειπωθεί για τις εργασίες του δεύτερου και τρίτου επιπέδου, καθώς χωρίς activation-tuning, το πλαίσιο SALMONN υποφέρει από over-fitting σε εργασίες. Η απόδοση μειώνεται ακόμη περισσότερο σε SQQA, SAC, και αφήγηση εργασίες με έμφαση σε πολυτροπικές αλληλεπιδράσεις, και το πλαίσιο SALMONN δυσκολεύεται να ακολουθήσει οδηγίες χωρίς activation-tuning. Ωστόσο, με activation-tuning, τα αποτελέσματα βελτιώνονται σημαντικά, και τα αποτελέσματα περιλαμβάνονται στην ακόλουθη εικόνα.

Discounting LoRA Scaling Factor
Η Discounting LoRA Scaling Factor αξιολογεί την επίδραση της χρήσης του LoRA scaling factor για να ελαττώσει τα over-fitting προβλήματα σε εργασίες. Όπως μπορείτε να δείτε στην ακόλουθη εικόνα, μια μείωση του LoRA scaling factor σε 2.0 αυξάνει την cross-modal συλλογιστική ικανότητα του πλαισίου SALMONN σε ASR και PR εργασίες, SQQA εργασίες, αφήγηση εργασίες, και SAC εργασίες.

Αξιολόγηση Εργασίας Over-Fitting
Για να τονίσει την activation-tuning, το πλαίσιο SALMONN αναλύει τις αλλαγές στην perplexity κατά τη διάρκεια των τριών εκπαίδευσης φάσεων, και όπως μπορείτε να δείτε στην ακόλουθη εικόνα, οι αλλαγές στην perplexity για AAC και ASR εργασίες έχουν μικρές τελικές τιμές μετά την πρώτη εκπαίδευση φάση, υποδεικνύοντας την μάθηση του μοντέλου των cross-modal συσχετίσεων.

Επιπλέον, η perplexity της PR εργασίας μειώνεται επίσης μετά την οδηγία fine-εκπαίδευση λόγω της εξάρτησής της από το LoRA component για να μάθει τα εξόδου tokens. Επίσης, παρατηρείται ότι αν και η οδηγία fine-εκπαίδευση βοηθά στην μείωση της perplexity στις εργασίες αφήγησης και SAC, ο χάσμα είναι ακόμη αρκετά μεγάλος για να εκτελεστεί η εργασία με επιτυχία, εκτός αν προστεθεί μια επιπλέον activation φάση ή αφαιρεθεί το LoRA component.
Activation Tuning
Το πλαίσιο SALMONN διεισδύει σε διάφορες activation μεθόδους, συμπεριλαμβανομένης της εκπαίδευσης του μοντέλου σε κείμενο-基準 ερωτήσεων και απαντήσεων με μεγάλες απαντήσεις, ή της χρήσης ακουστικών μεγάλων γραπτών ιστοριών, ενώ η χρήση μεγάλων ομιλίας μεταγραφών για ASR εργασίες. Και ο Q-Former και LoRA components fine-εκπαιδεύονται με αυτές τις τρεις μεθόδους. Επιπλέον, το πλαίσιο αγνοεί τις ακουστικές και Q-Former εισόδους για να fine-εκπαιδεύσει τα LoRA και Vicuna components ως ένα προσαρμοσμένο κείμενο-基準 μεγάλο γλωσσικό μοντέλο, και τα αποτελέσματα παρουσιάζονται στην ακόλουθη εικόνα, και όπως μπορείτε να δείτε, το μοντέλο δεν μπορεί να ενεργοποιηθεί από ASR (εκπαίδευση ASR με μεγάλες ετικέτες), ούτε από αφήγηση ή κείμενο-基準 με την εκπαίδευση του LoRA component με κείμενο προτροπές.

Τελικές Σκέψεις
Σε αυτό το άρθρο, έχουμε μιλήσει για το SALMONN ή Speech Audio Language Music Open Neural Network, ένα μονό audio-text πολυτροπικό μεγάλο γλωσσικό μοντέλο που μπορεί να αντιλαμβανθεί και να κατανοήσει τρεις βασικές ακουστικές ή ήχους τύπους, συμπεριλαμβανομένων ομιλίας, ακουστικών γεγονότων, και μουσικής. Το μοντέλο SALMONN ermöglicht τα Μεγάλα Γλωσσικά Μοντέλα να κατανοούν και να επεξεργάζονται γενικές ακουστικές εισόδους απευθείας, και να παρέχουν ανταγωνιστική απόδοση σε eine ευρεία γκάμα ακουστικών και ομιλίας εργασιών.
Το πλαίσιο SALMONN παρέχει ανταγωνιστική απόδοση σε eine ευρεία γκάμα εκπαιδευμένων εργασιών, συμπεριλαμβανομένων ακουστικής legend, ομιλίας μετάφρασης και αναγνώρισης, και πολλά άλλα, ενώ γενικεύει σε eine ευρεία γκάμα ανεκπαιδευμένων κατανόησης εργασιών, συμπεριλαμβανομένων ομιλίας μετάφρασης για keyword εξαγωγή και ανεκπαιδευμένες γλώσσες. Λόγω των ικανοτήτων του, το πλαίσιο SALMONN μπορεί να θεωρηθεί ως το επόμενο βήμα για την ενίσχυση των γενικών ακρόασης ικανοτήτων των μεγάλων γλωσσικών μοντέλων.












