Μοντέλα και πλατφόρμες AI

Η IBM δηλώνει ότι το Granite Speech 5.0 μεταγράφει 3,5 ώρες ομιλίας σε ένα δευτερόλεπτο

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η IBM κυκλοφόρησε δύο συμπαγή αγγλικά μοντέλα αναγνώρισης ομιλίας στις 25 Αυγούστου 2026, ισχυριζόμενη ότι η ταχύτητα μεταγραφής δεν έχει καταγραφεί ποτέ από ανοιχτό μοντέλο: πάνω από 3,5 ώρες ομιλίας επεξεργασμένες σε ένα δευτερόλεπτο. Το ζευγάρι, Granite Speech 5.0 TurboCTC και η μη εμπορική του αντίστοιχη έκδοση, διαθέτουν μόνο 470 εκατομμύρια παραμέτρους, και η εταιρεία αναφέρει συνολική απόδοση πάνω από 12,600 RTFx σε μία μόνο GPU NVIDIA H200, πράγμα που σημαίνει ότι ο ήχος διασχίζει τα μοντέλα περισσότερο από δώδεκα χιλιάδες φορές πιο γρήγορα από το πραγματικό χρόνο.

Η ταχύτητα συνοδεύεται από ανταγωνιστική ακρίβεια, τουλάχιστον με βάση τα νούμερα της IBM. Στα δημόσια αγγλικά σύνολα δοκιμών σύντομης μορφής του OpenASR Leaderboard, η μη εμπορική παραλλαγή καταγράφει συνολικό ποσοστό σφάλματος λέξεων 4,85 % και η ανοιχτά αδειοδοτημένη παραλλαγή 5,00 %, σύμφωνα με την ανακοίνωση της IBM. Και οι δύο αριθμοί είναι αναφορά προμηθευτή: η IBM τους χαρακτηρίζει ως ανεπίσημους, αν και η εκτέλεση έγινε μέσω της δικής της υποδομής εργασιών του Hugging Face και αξιολογήθηκε με τα εργαλεία του leaderboard, έτσι η εταιρεία αναμένει να ταιριάζουν με τον επίσημο πίνακα μόλις ενημερωθεί.

Τα δύο μοντέλα είναι πανομοιότυπα ως προς το μέγεθος και την αρχιτεκτονική και διαφέρουν στα δεδομένα εκπαίδευσης και στην άδεια. Το μοντέλο Apache 2.0 εκπαιδεύτηκε με περίπου 60.000 ώρες αγγλικού ήχου και είναι εγκεκριμένο για εμπορική χρήση. Η μη εμπορική παραλλαγή προσθέτει τα GigaSpeech και SPGI Speech, περίπου 15.000 επιπλέον ώρες, φέρνοντας το σώμα δεδομένων του κοντά στις 75.000 ώρες υπό άδεια CC‑BY‑NC‑SA‑4.0. Η IBM δηλώνει ότι τα επιπλέον δεδομένα προσφέρουν μια ήπια βελτίωση στην ακρίβεια στα περισσότερα σύνολα δοκιμών, με πιο εμφανές πλεονέκτημα στο SPGI Speech και εμφανή μειονέκτημα στη νέα κατακερματισμένη δοκιμή Earnings22 του leaderboard.

Ένας κωδικοποιητής χωρίς γλωσσικό μοντέλο

Η αξίωση ταχύτητας βασίζεται σε όσα άφησε εκτός η IBM. Οι προηγούμενες κυκλοφορίες του Granite Speech (οι σειρές 3.3 και 4.x που τεκμηριώνονται στο εγχειρίδιο Granite Speech της IBM) προσάρτησαν έναν ακουστικό κωδικοποιητή Conformer σε ένα γλωσσικό μοντέλο Granite μέσω ενός προβολέα και προσαρμογέων LoRA, δημιουργώντας κείμενο αυτόματης παλινδρόμησης όπως κάνει ένα μοντέλο συνομιλίας. Τα μοντέλα 5.0 αφαιρούν εντελώς το γλωσσικό μοντέλο. Αυτό που απομένει είναι ένας 16‑επίπεδος κωδικοποιητής Conformer εκπαιδευμένος με ταξινόμηση χρονικής σύνδεσης (CTC), ένα σχήμα αποκωδικοποίησης που αντιστοιχίζει τα πλαίσια ήχου απευθείας σε διακριτικά εξόδου σε μία μη‑αυτόματη διέλευση με άπληστη αποκωδικοποίηση.

Δύο ακόμη αλλαγές κάνουν το μεγαλύτερο μέρος της δουλειάς. Ενώ οι προηγούμενοι κωδικοποιητές Granite παρήγαγαν 50 χαρακτήρες ανά δευτερόλεπτο, τα νέα μοντέλα παράγουν 12,5 διακριτικά ανά δευτερόλεπτο, επιτυγχάνοντας το μέσω τριών σταδίων 2× χρονικής υποδειγματοληψίας από το προ‑επεξεργαστικό log‑Mel 100 καρέ ανά δευτερόλεπτο. Επιπλέον, το λεξιλόγιο εξόδου μετατοπίστηκε από χαρακτήρες σε 16.384 εκπαιδευμένες υπομονάδες λέξεων, SentencePiece στο μη εμπορικό μοντέλο και BPE στο Apache. Λιγότερα, πιο μακρά διακριτικά σε τέταρτο του ρυθμού καρέ είναι αυτό που ωθεί την απόδοση πέρα από 20× αυτή των προηγούμενων μοντέλων Granite Speech, σύμφωνα με την IBM.

Η ανταλλαγή είναι μεταξύ ευρείας λειτουργικότητας και εστίασης στη μεταγραφή. Χωρίς το γλωσσικό μοντέλο, αυτά τα μοντέλα χάνουν τη δυνατότητα μετάφρασης ομιλίας και την προτίμηση λέξεων‑κλειδιών που υποστηριζόταν στην προηγούμενη έκδοση. Αυτό που κερδίζουν είναι ένα αποτύπωμα κατάλληλο για φορητούς υπολογιστές και εξοπλισμό άκρων: η IBM τοποθετεί το ζευγάρι για επιχειρηματική μετατροπή ομιλίας‑σε‑κείμενο όπου η καθυστέρηση και η απόδοση έχουν μεγαλύτερη σημασία από ένα μοντέλο που μπορεί επίσης να λογίζεται τι άκουσε.

Τι δείχνουν και τι δεν δείχνουν οι αξιολογήσεις

Το ισχυρότερο ανεξάρτητο σήμα μέχρι τώρα προέρχεται από ήχο μακριά από το μικρόφωνο. Στο FFASR Leaderboard, που μετρά την αναγνώριση θορυβώδους, αντηλιακού ήχου, η IBM αναφέρει επίσημα αποτελέσματα μέχρι τις 25 Αυγούστου 2026, τοποθετώντας το μη εμπορικό μοντέλο στην πέμπτη θέση ακρίβειας και το μοντέλο Apache στην ένατη — ενώ και τα δύο κατατάσσονται ως οι δύο πιο γρήγορες καταχωρίσεις στον πίνακα, με απόδοση μετρημένη σε μία μόνο GPU NVIDIA L4. Το FFASR αξιολογεί μοντέλα σε θορυβώδη, αντηλιακό και κίνηση πηγής ήχο σε πολλαπλές SNR, συνθήκες στις οποίες η αναγνώριση σε απόσταση υποβαθμίζεται, σύμφωνα με την περιγραφή του leaderboard.

Το εντυπωσιακό νούμερο των 12.600 RTFx χρειάζεται όμως το πλαίσιο του. Πρόκειται για αριθμό παρτίδας εκτέλεσης σε μία από τις πιο γρήγορες GPU κέντρων δεδομένων που πωλούνται, όχι για αυτό που θα δει ένας φορητός υπολογιστής που τρέχει τη δοκιμή ροής WebGPU. Τα συνολικά ποσοστά σφάλματος λέξεων (WER) καλύπτουν μόνο σύντομη μορφή αγγλικών, και οι επίσημες κατατάξεις του OpenASR Leaderboard, που περιλαμβάνουν ιδιωτικά σύνολα δοκιμών, δεν είχαν ακόμη ενσωματώσει τα νέα μοντέλα κατά τη δημοσίευση. Η δική της παρουσίαση της IBM είναι η ειλικρινής εδώ: αυτά είναι ισχυρά αποτελέσματα που αναφέρονται από τον προμηθευτή και αναμένουν επιβεβαίωση από το leaderboard.

Η συνταγή εκπαίδευσης αξίζει επίσης σημείωση για το τι λέει σχετικά με το άνοιγμα των δεδομένων. Κάθε σύνολο δεδομένων στα σώματα των δύο μοντέλων είναι δημόσια διαθέσιμο, και οι 2.740 ώρες συνθετικών προσθηκών αποτελούν 2.500 ώρες πολυ‑ομιλητικού ήχου που συνενώθηκαν από τμήματα μονό‑ομιλητου, συν 240 ώρες εκφράσεων που δημιουργήθηκαν από τα ανοιχτά βάρη μοντέλων gpt‑oss της OpenAI και συνθέθηκαν με το StyleTTS2, στοχεύοντας στους αριθμούς, τα νομίσματα και τις διευθύνσεις που προκαλούν προβλήματα στους αναγνωστές. Η εκπαίδευση διήρκεσε 10 ημέρες σε 8 GPU NVIDIA H100 στο σύμπλεγμα Blue Vela της IBM, σύμφωνα με την κάρτα μοντέλου.

Και τα δύο μοντέλα είναι ζωντανά στο Hugging Face τώρα με εγγενή υποστήριξη στη βιβλιοθήκη transformers — εγκατεστημένα από πηγαίο κώδικα μέχρι την επόμενη έκδοση — υπό τη συλλογή Granite Speech, και μια δοκιμή ροής βασισμένη σε πρόγραμμα περιήγησης εκτελείται σε Chrome και Edge. Για μια εικόνα του πού βρίσκονται τα εξειδικευμένα μοντέλα μεταγραφής σε σχέση με τις εμπορικές υπηρεσίες, δείτε τη συγκέντρωσή μας για το λογισμικό AI μεταγραφής.

Ο Jonas Reeve είναι ένας αναλυτής που δημιουργείται από AI στη Unite.AI, με επίκεντρο την γνωστική AI, την τεχνητή γενική νοημοσύνη (AGI) και τις θεωρητικές βάσεις της μηχανικής νοημοσύνης. Το έργο του εξετάζει πώς η μάθηση, ο συλλογισμός, η μνήμη και η αφαίρεση εμφανίζονται και σε βιολογικά και τεχνητά συστήματα, δημιουργώντας συνδέσεις μεταξύ σύγχρονων αρχιτεκτονικών AI και μακροχρόνιων ερωτημάτων στις γνωστικές επιστήμες και τη φιλοσοφία του νου. Με μια концепτουαλιστική και αναστοχαστική προσέγγιση, ο Jonas εξετάζει πλαισιά όπως τα μοντέλα συλλογισμού, τα συστήματα agentic, η αναδυόμενη γνωστική και η θεωρία ευθυγράμμισης, με στόχο να αποσαφηνίσει τι σημαίνει πραγματικά η πρόοδος προς την AGI - και τι όχι. Αντί να κυνηγά χρονοδιαγράμματα ή υπεροπτικές εκφράσεις, τονίζει τις αρχές, τη концепτουαλιστική αυστηρότητα και τα όρια των τρεχόντων μοντέλων. Τα άρθρα που γράφονται από τον Jonas Reeve δημιουργούνται από AI και αναθεωρούνται από την редакτική ομάδα της Unite.AI για να διασφαλιστεί η ακρίβεια, η σαφήνεια και η υπεύθυνη συζήτηση για προηγμένα концеп AI.