Μοντέλα και πλατφόρμες AI
Η CNTXT AI Εκκινεί το Munsit: Το Πιο Ακριβές Σύστημα Αναγνώρισης Ομιλίας στα Αραβικά που Έχει Δημιουργηθεί Ποτέ
Σε μια οριστική στιγμή για την αραβική γλώσσα της τεχνητής νοημοσύνης, η CNTXT AI έχει παρουσιάσει το Munsit, ένα μοντέλο αναγνώρισης ομιλίας στα αραβικά της επόμενης γενιάς που δεν είναι μόνο το πιο ακριβές που έχει δημιουργηθεί ποτέ για τα αραβικά, αλλά και ένα που υπερέχει αποφασιστικά από τους παγκόσμιους γίγαντες όπως η OpenAI, η Meta, η Microsoft (MSFT ) και η ElevenLabs σε τυποποιημένα benchmarks. Αναπτυγμένο στα Ηνωμένα Αραβικά Εμιράτα και προσαρμοσμένο για τα αραβικά από την αρχή, το Munsit αντιπροσωπεύει ένα ισχυρό βήμα προς τα εμπρός σε αυτό που η CNTXT ονομάζει «αυτοδύναμη τεχνητή νοημοσύνη» – τεχνολογία που κατασκευάζεται στην περιοχή, για την περιοχή, αλλά και με παγκόσμια ανταγωνιστικότητα.
Οι επιστημονικές βάσεις αυτής της επιτεύξης παρουσιάζονται στο πρόσφατο έγγραφο της ομάδας, “Προώθηση της Αναγνώρισης Ομιλίας στα Αραβικά Μέσω Μεγάλης Κλίμακας Ασθενώς Εποπτευόμενης Μάθησης“, το οποίο εισάγει μια μεθοδολογία εκπαίδευσης που είναι ευέλικτη και αποδοτική σε δεδομένα, και αντιμετωπίζει το μακροχρόνιο πρόβλημα της έλλειψης ετικετών ομιλίας στα αραβικά. Αυτή η μέθοδος – η ασθενής εποπτεία – έχει επιτρέψει στην ομάδα να κατασκευάσει ένα σύστημα που θέτει einen νέο chuẩn για την ποιότητα μεταγραφής σε cả τα Σύγχρονα Τυποποιημένα Αραβικά (MSA) και πάνω από 25 περιφερειακές διαλέκτους.
Καταπολέμηση της Ελλείψης Δεδομένων στα Αραβικά ASR
Τα αραβικά, παρά το ότι είναι μια από τις πιο ευρέως ομιλούμενες γλώσσες παγκοσμίως και μια επίσημη γλώσσα των Ηνωμένων Εθνών, έχουν θεωρηθεί ως μια γλώσσα με περιορισμένα δεδομένα στον τομέα της αναγνώρισης ομιλίας. Αυτό οφείλεται και στην μορφολογική複雑性 και στην έλλειψη μεγάλων, διαφορετικών, ετικετών ομιλίας. Σε αντίθεση με τα αγγλικά, τα οποία επωφελούνται απόcountless ώρες χειροκίνητα μεταγραφείσας ήχου, η πλούσια διαλεκτική ποικιλία και η θραυσματική ψηφιακή παρουσία των αραβικών έχουν δημιουργήσει σημαντικές προκλήσεις για την κατασκευή ισχυρών συστημάτων αναγνώρισης ομιλίας (ASR).
Αντί να περιμένουν τη chậmη και δαπανηρή διαδικασία της χειροκίνητης ετικέτας να προχωρήσει, η CNTXT AI ακολούθησε einen πιο ευέλικτο δρόμο: την ασθενής εποπτεία. Η προσέγγισή τους ξεκίνησε με ένα τεράστιο σώμα από πάνω από 30.000 ώρες μη ετικετώνησης ομιλίας στα αραβικά που συλλέχθηκαν από διάφορες πηγές. Μέσω ενός εξειδικευμένου πipelines επεξεργασίας δεδομένων, αυτός ο сырой ήχος καθαρίστηκε, χωρίστηκε και αυτόματα ετικετώθηκε για να παραχθεί ένα υψηλής ποιότητας 15.000ωρο σύνολο δεδομένων εκπαίδευσης – ένα από τα μεγαλύτερα και πιο αντιπροσωπευτικά σώματα ομιλίας στα αραβικά που έχουν συναθροιστεί ποτέ.
Αυτή η διαδικασία δεν βασίστηκε στην ανθρώπινη ετικέτα. Αντίθετα, η CNTXT ανέπτυξε ένα πολυστάθμιο σύστημα για τη δημιουργία, αξιολόγηση και φιλτράρισμα υποθέσεων από πολλαπλά μοντέλα ASR. Αυτές οι μεταγραφές συγκρίθηκαν χρησιμοποιώντας την απόσταση Levenshtein για την επιλογή των πιο συνεπών υποθέσεων, και στη συνέχεια περάστηκαν από ένα γλωσσικό μοντέλο για την αξιολόγηση της γραμματικής τους πιθανοτητας. Τα τμήματα που δεν πληρούσαν τις ορισμένες προδιαγραφές ποιότητας απορρίφθηκαν, διασφαλίζοντας ότι ακόμη και χωρίς ανθρώπινη επαλήθευση, τα δεδομένα εκπαίδευσης παρέμειναν αξιόπιστα. Η ομάδα βελτίωσε αυτό το pipeline μέσω πολλαπλών επαναλήψεων, κάθε φορά βελτιώνοντας την ακρίβεια ετικέτας ανατρέχοντας το σύστημα ASR και τοποθετώντας το πίσω στη διαδικασία ετικέτας.
Δynaμική του Munsit: Η Αρχιτεκτονική Conformer
Στην καρδιά του Munsit βρίσκεται το μοντέλο Conformer, μια υβριδική αρχιτεκτονική νευρωνικού δικτύου που συνδυάζει την τοπική ευαισθησία των στρωμάτων convolution με τις δυνατότητες μοντελοποίησης ακολουθίας των transformers. Αυτή η σχεδίαση καθιστά το Conformer ιδιαίτερα ικανό να αντιμετωπίζει τις νюανς της ομιλίας, όπου και οι μακροπρόθεσμες εξαρτήσεις (όπως η δομή της πρότασης) και οι λεπτομερείς φωνητικές λεπτομέρειες είναι κρίσιμες.
Η CNTXT AI υλοποίησε μια μεγάλη εκδοχή του Conformer, εκπαιδεύοντάς το από την αρχή χρησιμοποιώντας 80-κανάλι mel-spectrograms ως είσοδο. Το μοντέλο αποτελείται από 18 στρώματα και περιλαμβάνει περίπου 121 εκατομμύρια παραμέτρους. Η εκπαίδευση διεξήχθη σε ένα υψηλής απόδοσης cluster χρησιμοποιώντας οκτώ NVIDIA A100 GPUs με bfloat16 ακρίβεια, επιτρέποντας την αποτελεσματική αντιμετώπιση μεγάλων batch sizes και υψηλών διαστατικών χώρων χαρακτηριστικών. Για την τοκενοποίηση της μορφολογικά πλούσιας δομής των αραβικών, η ομάδα χρησιμοποίησε einen SentencePiece τοκενοποιητή που εκπαιδεύτηκε ειδικά στο δικό τους σώμα, με αποτέλεσμα einen λεξιλόγιο 1.024 υπο-λεξικών μονάδων.
Αντί για την παραδοσιακή επιβλεπόμενη εκπαίδευση ASR, η οποία τυπικά απαιτεί κάθε clip ήχου να είναι ζευγαρωμένο με μια προσεκτικά μεταγραφείση ετικέτα, η μέθοδος της CNTXT λειτουργούσε εξ ολοκλήρου με ασθενής ετικέτα. Αυτές οι ετικέτες, αν και θορυβώδεις hơn από τις ανθρώπινες ετικέτες, βελτιώθηκαν μέσω ενός βρόχου ανατροφοδότησης που προώθησε την συναίνεση, τη γραμματική συνάφεια και τη λεξική πιθανοτητα. Το μοντέλο εκπαιδεύτηκε χρησιμοποιώντας την Συνδετική Χρονική Ταξινόμηση (CTC) συνάρτηση απώλειας, η οποία είναι κατάλληλη για μοντελοποίηση ακολουθίας που δεν είναι συγχρονισμένη – κρίσιμη για εργασίες αναγνώρισης ομιλίας όπου ο χρόνος των ομιλούμενων λέξεων είναι μεταβλητός και απρόβλεπτος.
Κάτω από τα Benchmark
Τα αποτελέσματα μιλούν από μόνα τους. Το Munsit δοκιμάστηκε ενάντια σε leading ανοιχτού κώδικα και εμπορικά μοντέλα ASR σε έξι benchmark datasets στα αραβικά: SADA, Common Voice 18.0, MASC (καθαρό και θορυβώδες), MGB-2, και Casablanca. Αυτά τα datasets коллекτίβως καλύπτουν δεκάδες διαλέκτους και προφορές σε όλο τον αραβικό κόσμο, από τη Σαουδική Αραβία στο Μαρόκο.
Σε όλα τα benchmark, το Munsit-1 πέτυχε einen μέσο Όρο Σφάλματος Λέξης (WER) της τάξης του 26,68 και einen μέσο Όρο Σφάλματος Χαρακτήρων (CER) της τάξης του 10,05. Σε σύγκριση, η καλύτερη εκδοχή του OpenAI’s Whisper κατέγραψε einen μέσο WER της τάξης του 36,86 και CER της τάξης του 17,21. Το SeamlessM4T της Meta, ένα άλλο state-of-the-art πολυγλωσσικό μοντέλο, ήρθε ακόμη υψηλότερα. Το Munsit υπερέβη κάθε άλλο σύστημα και σε καθαρές και θορυβώδεις συνθήκες, και απέδειξε ιδιαίτερη ανθεκτικότητα σε θορυβώδεις συνθήκες, einen κρίσιμο παράγοντα για πραγματικές εφαρμογές όπως τα κέντρα εξυπηρέτησης και οι δημόσιες υπηρεσίες.
Το χάσμα ήταν εξίσου δραματικό ενάντια σε ιδιωτικά συστήματα. Το Munsit υπερέβη τα αραβικά μοντέλα ASR της Microsoft Azure, το Scribe της ElevenLabs και ακόμη και την δυνατότητα transcribe της OpenAI’s GPT-4o. Αυτά τα αποτελέσματα δεν είναι περιθωριακές βελτιώσεις – αντιπροσωπεύουν einen μέσο σχετικό βελτίωση της τάξης του 23,19% στο WER και 24,78% στο CER σε σύγκριση με το ισχυρότερο ανοιχτό baseline, καθιστώντας το Munsit την καθαρή ηγέτιδα στην αναγνώριση ομιλίας στα αραβικά.
Μια Πλατφόρμα για το Μέλλον της Αραβικής Φωνητικής Νοημοσύνης
Ενώ το Munsit-1 έχει ήδη μεταμορφώσει τις δυνατότητες για μεταγραφή, υποτιτλισμό και εξυπηρέτηση πελατών στις αραβόφωνες αγορές, η CNTXT AI βλέπει αυτό το lanç ως μόνο την αρχή. Η εταιρεία οραματίζεται ένα πλήρες σύνολο αραβικών τεχνολογιών φωνής, συμπεριλαμβανομένων text-to-speech, φωνητικών βοηθών και συστημάτων μετάφρασης σε πραγματικό χρόνο – όλα βασισμένα σε εγχώρια υποδομή και περιφερειακά σχετικές τεχνολογίες νοημοσύνης.
«Το Munsit είναι περισσότερο από ένα βήμα στην αναγνώριση ομιλίας», είπε ο Mohammad Abu Sheikh, Διευθύνων Σύμβουλος της CNTXT AI. «Είναι μια δήλωση ότι τα αραβικά ανήκουν στην πρώτη γραμμή της παγκόσμιας νοημοσύνης. Έχουμε αποδείξει ότι η κορυφαία τεχνητή νοημοσύνη δεν χρειάζεται να εισαχθεί – μπορεί να κατασκευαστεί εδώ, στα αραβικά, για τα αραβικά».
Με την άνοδο των περιφερειακών μοντέλων όπως το Munsit, η βιομηχανία νοημοσύνης εισέρχεται σε eine νέα εποχή – μια εποχή όπου η γλωσσική και πολιτισμική σχετικότητα δεν θυσιάζονται στην αναζήτηση της τεχνικής αριστείας. Στην πραγματικότητα, με το Munsit, η CNTXT AI έχει δείξει ότι είναι ένα και το αυτό.












