Μοντέλα και πλατφόρμες AI

xAI Κυκλοφορεί το Grok Voice Transcribe 2.0, μοντέλο μετατροπής ομιλίας σε κείμενο

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η xAI κυκλοφόρησε το Grok Voice Transcribe 2.0, το πιο πρόσφατο μοντέλο μετατροπής ομιλίας σε κείμενο, στις 18 Σεπτεμβρίου 2026, με τιμή παρτίδας $0.10 ανά ώρα ήχου, περιγράφοντας το μοντέλο ως δύο φορές πιο ακριβές από το Grok Voice Transcribe 1.0.

Το Grok Voice Transcribe 2.0 βασίζεται στο μοντέλο θεμελιώδους ήχου που βρίσκεται πίσω από το Grok Voice. Σύμφωνα με την xAI, το Grok Voice ήδη υποστηρίζει δεκάδες χιλιάδες κλήσεις εξυπηρέτησης πελατών καθημερινά, μεταγράφει εκατομμύρια ώρες αφήγησης βίντεο και λειτουργεί ως φωνητικοί πράκτορες σε φυσικά προϊόντα, συμπεριλαμβανομένου του βοηθού Grok στα οχήματα Tesla. Η εταιρεία δήλωσε ότι το νέο μοντέλο εκπαιδεύτηκε σε ζωντανό, θορυβώδες, πολυγλωσσικό ήχο που ηχογραφήθηκε σε ένα ευρύ φάσμα περιβαλλόντων και βελτιώθηκε με μετα‑εκπαίδευση, και περιέγραψε το αποτέλεσμα ως ένα από τα πιο ακριβή μοντέλα μεταγραφής διαθέσιμα για ομιλία σε πραγματικές συνθήκες.

Αξιολογήσεις Ακρίβειας

Η xAI δήλωσε ότι το Grok Voice Transcribe 2.0 κατατάσσεται πρώτο σε ακρίβεια μεταξύ 32 μοντέλων ροής στην δημόσια κατάταξη Artificial Analysis. Πέρα από τα δημόσια benchmarks, η εταιρεία μετρά το ποσοστό σφάλματος λέξεων σε τέσσερις εσωτερικές ομάδες αξιολόγησης που προέρχονται από την παραγωγική κίνηση: ηχητικό τηλεφωνικό υλικό από κλήσεις εξυπηρέτησης πελατών, συνομιλίες με το Grok, προφορικά διαπιστευτήρια όπως κωδικοί λογαριασμών και διευθύνσεις email, και σύντομες πολύγλωσσες φωνητικές εντολές. Η εταιρεία ανέφερε ότι το νέο μοντέλο βελτιώνεται σε σχέση με το Grok Voice Transcribe 1.0 σε όλες τις τέσσερις ομάδες και υπερέχει σε κάθε μοντέλο που δοκίμασε στην τηλεφωνική ομάδα, η οποία αποτελείται από κλήσεις εξυπηρέτησης πελατών στα αγγλικά με συχνότητα 8 kHz. Τα δημοσιευμένα διαγράμματα της xAI συγκρίνουν το μοντέλο με τα Gemini 3.5 Transcribe, MAI-Transcribe-2, ElevenLabs Scribe v2, Deepgram Nova-3 και Whisper Large v3 σε αυτές τις εσωτερικές ομάδες.

Η πολυγλωσσική μεταγραφή αποτελεί τη μεγαλύτερη βελτίωση στην ακρίβεια σε σχέση με την έκδοση 1.0, σύμφωνα με την xAI. Η εταιρεία ανέφερε ότι το μοντέλο μεταγράφει δεκάδες γλώσσες, εντοπίζει αυτόματα τη γλώσσα και ακολουθεί αλλαγές γλώσσας κατά τη διάρκεια της ηχογράφησης σε μία μόνο διεργασία. Οι σύντομες φράσεις, όπως εντολές εντός οχήματος, παρέχουν στο μοντέλο ελάχιστο πλαίσιο για την αναγνώριση της γλώσσας· στο σύνολο σύντομων φράσεων φωνητικού βοηθού της xAI που καλύπτει 19 γλώσσες, το ποσοστό σφάλματος λέξεων μειώνεται από 20.6 τοις εκατό σε 6.8 τοις εκατό, ανέφερε η εταιρεία.

Χαρακτηριστικά και Πρόσβαση API

Μέσω του API Speech-to-Text, το Grok Voice Transcribe 2.0 διαχειρίζεται παρτίδα μεταγραφής εγγεγραμμένων αρχείων και URL, καθώς και ροή σε πραγματικό χρόνο. Το τεκμηριωμένο σύνολο χαρακτηριστικών περιλαμβάνει χρονικές σημάνσεις λέξεων με βαθμολογίες εμπιστοσύνης, διαχωρισμό ομιλητών χωρίς επιπλέον κόστος, πολυκαναλική μεταγραφή έως οκτώ κανάλια, προσανατολισμό βασικών όρων έως 100 όρους τομέα ανά αίτηση, μορφοποίηση κειμένου που επιστρέφει αριθμούς, ημερομηνίες, νομίσματα, αριθμούς τηλεφώνου και διευθύνσεις email σε γραπτή μορφή, αφαίρεση γεμιστικών λέξεων και έξυπνη ανίχνευση αλλαγής σειράς που εντοπίζει το τέλος της σειράς του ομιλητή για φωνητικούς πράκτορες. Η xAI δήλωσε ότι οι υπάρχουσες ενσωματώσεις του Speech-to-Text API λαμβάνουν τη βελτίωση στην ακρίβεια χωρίς αλλαγές κώδικα.

Η επίσημη τεκμηρίωση μετατροπής ομιλίας σε κείμενο αναφέρει 12 υποστηριζόμενες μορφές ήχου, μέγιστο μέγεθος αρχείου 500 MB και συχνότητες δειγματοληψίας 8000, 16000, 22050, 24000, 44100 και 48000 Hz. Μια παράμετρος γλώσσας ενεργοποιεί τη μορφοποίηση σε γραπτή μορφή για 25 γλώσσες, μεταξύ των οποίων τα Αγγλικά, Ισπανικά, Γαλλικά, Γερμανικά, Χίντι, Ιαπωνικά και Κορεατικά.

Τα αιτήματα παρτίδας χρησιμοποιούν δεδομένα multipart form και πρέπει να παρέχουν είτε ένα ανεβασμένο αρχείο είτε ένα URL για να το κατεβάσει και να το μεταγράψει ο διακομιστής· η απάντηση επιστρέφει τη πλήρη μεταγραφή, τη εντοπισμένη γλώσσα ως κώδικα BCP-47, τη διάρκεια ήχου σε δευτερόλεπτα και τμήματα λέξεων με χρόνους έναρξης και λήξης. Για ροή, οι πελάτες στέλνουν ακατέργαστο ήχο ως δυαδικά πλαίσια σε ένα σημείο WebSocket στο wss://api.x.ai/v1/stt και λαμβάνουν γεγονότα μεταγραφής JSON καθώς επεξεργάζεται ο ήχος, με προαιρετικά ενδιάμεσα αποτελέσματα που εκδίδονται περίπου κάθε 500 χιλιοστά του δευτερολέπτου.

Ανάπτυξη στο Loom, Τιμολόγηση και Απόσυρση

Η xAI δήλωσε ότι η Atlassian αξιολόγησε το Grok Voice Transcribe 2.0 σε σύγκριση με την υπάρχουσα λύση μεταγραφής της, το βρήκε πιο ακριβές και τώρα χρησιμοποιεί το μοντέλο για τη μεταγραφή κάθε βίντεο στο Loom, το προϊόν καταγραφής οθόνης της. η ανακοίνωση της xAI παρα quoting Sanchan Saxena, senior vice president of Teamwork Collection at Atlassian, σχετικά με τις ροές εργασίας που μεταφέρουν τις μεταγραφές του Loom στο εργαλείο κώδικα Cursor: “Με το Grok να τροφοδοτεί τη μετατροπή ομιλίας σε κείμενο του Loom και το Cursor να το μετατρέπει σε κώδικα, κλείνουμε το κύκλο από το πλαίσιο στον κώδικα: καταγράψτε ό,τι εννοείτε και η εργασία ολοκληρώνεται.”

Η τιμολόγηση είναι ίδια με το Grok Voice Transcribe 1.0: $0.10 ανά ώρα ήχου για παρτίδα μεταγραφής και $0.20 ανά ώρα για ροή, με συμπεριλαμβανόμενη διαχωρισμό ομιλητών, χρονικές σημάνσεις και βασικούς όρους. Η xAI δήλωσε ότι το Grok Voice Transcribe 2.0 θα γίνει σύντομα το προεπιλεγμένο μοντέλο στο Speech-to-Text API και ότι η έκδοση 1.0 θα αποσυρθεί τις επόμενες εβδομάδες· οι πελάτες που θέλουν να παραμείνουν στο παλαιότερο μοντέλο κατά τη μετάβαση μπορούν να κλειδώσουν το grok-voice-transcribe-1.0 στις αιτήσεις τους. Η τεκμηρίωση αυτή τη στιγμή αναφέρει το grok-voice-transcribe-1.0 ως προεπιλογή όταν παραλείπεται η παράμετρος μοντέλου, με το grok-voice-transcribe-2.0 διαθέσιμο και στα REST και στα WebSocket endpoints.

Ο Jonas Reeve είναι ένας αναλυτής που δημιουργείται από AI στη Unite.AI, με επίκεντρο την γνωστική AI, την τεχνητή γενική νοημοσύνη (AGI) και τις θεωρητικές βάσεις της μηχανικής νοημοσύνης. Το έργο του εξετάζει πώς η μάθηση, ο συλλογισμός, η μνήμη και η αφαίρεση εμφανίζονται και σε βιολογικά και τεχνητά συστήματα, δημιουργώντας συνδέσεις μεταξύ σύγχρονων αρχιτεκτονικών AI και μακροχρόνιων ερωτημάτων στις γνωστικές επιστήμες και τη φιλοσοφία του νου. Με μια концепτουαλιστική και αναστοχαστική προσέγγιση, ο Jonas εξετάζει πλαισιά όπως τα μοντέλα συλλογισμού, τα συστήματα agentic, η αναδυόμενη γνωστική και η θεωρία ευθυγράμμισης, με στόχο να αποσαφηνίσει τι σημαίνει πραγματικά η πρόοδος προς την AGI - και τι όχι. Αντί να κυνηγά χρονοδιαγράμματα ή υπεροπτικές εκφράσεις, τονίζει τις αρχές, τη концепτουαλιστική αυστηρότητα και τα όρια των τρεχόντων μοντέλων. Τα άρθρα που γράφονται από τον Jonas Reeve δημιουργούνται από AI και αναθεωρούνται από την редакτική ομάδα της Unite.AI για να διασφαλιστεί η ακρίβεια, η σαφήνεια και η υπεύθυνη συζήτηση για προηγμένα концеп AI.