Συνεντεύξεις
Dani Cherkassky, CEO και Συνιδρυτής της Kardome – Σειρά Συνεντεύξεων

Dani Cherkassky, CEO και Συνιδρυτής της Kardome, φέρνει πάνω από δύο δεκαετίες εμπειρίας στις ακουστικές, την επεξεργασία σημάτων και την ανάπτυξη αλγορίθμων στο επίκεντρο της καινοτομίας της φωνητικής τεχνολογίας. Πριν ιδρύσει την Kardome, υπηρέτησε ως CTO στην Silentium Ltd., όπου ηγήθηκε συνεργασιών ερευνάς και ανάπτυξης με εταιρείες Tier 1 και ερευνητικά ιδρύματα. Με διδακτορικό στη Μεγιστοποίηση της Ποιότητας των Μικροφωνικών Πινάκων από το Πανεπιστήμιο Bar-Ilan, ο Cherkassky συνδυάζει βαθιά τεχνική εμπειρία με μια σαφή αποστολή — να εξαλείψει τις απογοητεύσεις της σύγχρονης φωνητικής αλληλεπίδρασης δημιουργώντας τεχνολογία που ακούει πραγματικά τους ανθρώπους, όχι τον θόρυβο γύρω τους.
Kardome είναι пиονέρης λύσεων χωρικής ακοής που οδηγούν σε σαφείς, προσωποποιημένες φωνητικές αλληλεπιδράσεις σε οποιοδήποτε περιβάλλον — από αυτοκίνητα και αίθουσες συνεδριάσεων έως έξυπνα σπίτια και δημόσιους χώρους. Η ιδιοκτησιακή τεχνολογία της, η Speech-Clustering, διαχωρίζει τις φωνές με βάση τη θέση, επιτρέποντας στις συσκευές να κατανοούν κάθε ομιλητή σαν να ήταν ο μόνος που μιλάει. Σχεδιασμένη για να είναι ανεξάρτητη από το υλικό και έτοιμη για την άκρη, η πλατφόρμα της Kardome βελτιώνει την ακρίβεια αναγνώρισης ομιλίας, την ασφάλεια και την εμπειρία του χρήστη, ενεργοποιώντας την επόμενη γενιά της ανθρώπινης-μηχανικής επικοινωνίας.
Τι σας έμπνευσε εσάς και τον Δρ. Alon Slapak να ιδρύσετε την Kardome;
Η έμπνευση για την Kardome μεγάλωσε από μια συνδυασμένη έλξη και απογοήτευση. Με τα υπόβαθρά μας στην ομιλία και την ήχο, τόσο στην ακαδημία όσο και στη βιομηχανία, μας ενθούσιασε η πρόοδος στην αναγνώριση ομιλίας, ιδιαίτερα όταν τα βαθιά νευρωνικά δίκτυα εισήλθαν στη σκηνή.
Σε μια ήσυχη εργαστήριο, η τεχνολογία ήταν φανταστική. Αλλά τη στιγμή που βγήκατε στον πραγματικό κόσμο, αυτή η μαγεία εξαφανίστηκε. Παρατηρήσαμε ότι σε ένα θορυβώδες αυτοκίνητο, ένα απασχολημένο γραφείο ή ένα χαοτικό σπίτι, τα προηγμένα συστήματα ήταν σπάνια καλύτερα από την τεχνολογία της δεκαετίας του ’90. Αυτό ήταν το μεγάλο εμπόδιο στην πρόοδο.
Η φωνή είναι ο πιο φυσικός τρόπος για να αλληλεπιδράσουμε με τις συσκευές μας, ο真正 διάδοχος της οθόνης αφής. Αλλά για να συμβεί αυτό, η τεχνολογία χρειαζόταν να υπερβεί τον χάος της πραγματικής ζωής. Αποφασίσαμε να κάνουμε αυτή την αποστολή μας. Πέρασα ένα χρόνο στο γκαράζ, παλαιότερα με τις εξισώσεις προπαγάνδας του ήχου και δοκιμάζοντας νέες ιδέες, μέχρι να επιτύχουμε μια độtέευση: την πρώτη επίδειξη της τεχνολογίας που είναι τώρα γνωστή ως Spatial Hearing Technology της Kardome.
Σε εκείνη τη στιγμή, γνωρίζαμε ότι είχαμε το κλειδί. Ιδρύσαμε την Kardome όχι μόνο για να χτίσουμε ένα προϊόν, αλλά για να ξεκινήσουμε μια επανάσταση στο πώς οι άνθρωποι και οι μηχανές επικοινωνούν.
Πολλοί βοηθοί φωνής δυσκολεύονται και συχνά απογοητεύουν τους χρήστες όταν οι φωνές перекrýονται ή ο θόρυβος στο υπόβαθρο παίρνει τον έλεγχο. Γιατί οι συμβατικές μεθόδους εκτελούν इतनά κακά σε αυτές τις πραγματικές συνθήκες;
Οι συμβατικές διεπαφές φωνής εκτελούν κακά στον πραγματικό κόσμο επειδή το λογισμικό τους βασίζεται σε μια υπερβολικά απλή μέθοδο για να κατανοήσουν τον ήχο. Τα περισσότερα συστήματα χρησιμοποιούν πολλαπλά μικρόφωνα για να καθορίσουν την κατεύθυνση μιας φωνής, μια προσέγγιση που επικεντρώνεται μόνο στην γωνία μιας φωνής και αγνοεί άλλες κρίσιμες 3D χωρικές πληροφορίες. Αυτή η μέθοδος αποτυγχάνει αμέσως σε οποιοδήποτε πραγματικό περιβάλλον—όπως ένα αυτοκίνητο, ένα γραφείο ή ένα σαλόνι—επειδή αυτά τα περιβάλλοντα είναι γεμάτα από ανακλάσεις, όπου οι ήχοι ανακλώνται από κάθε ανακλαστική επιφάνεια. Για ένα σύστημα που κατανοεί μόνο την κατεύθυνση, κάθε μια από αυτές τις ανακλάσεις αντιλαμβάνεται ως einen νέο ήχο από διαφορετική τοποθεσία.
Αυτό δημιουργεί einen απογοητευτικό αποτέλεσμα, σαν να ήταν η συσκευή σε έναν θάλαμο ‘ακουστικών καθρεφτών’, όπου μια seule φωνή φαίνεται να έρχεται από εκατοντάδες κατευθύνσεις ταυτόχρονα. Unable να διακρίνει τις διακριτές φωνές των ομιλητών από την καταιγίδα των ανακλάσεων, το σύστημα δεν μπορεί να αποκωδικοποιήσει σωστά τις ήχους. Αυτό το θεμελιώδες εμπόδιο είναι ακριβώς το λόγο για τον οποίο οι τρέχουσες τεχνολογίες φωνής έχουν τόσο καλή αντίληψη του ήχου σε πραγματικές, χαοτικές σκηνές και τελικά αποτυγχάνουν να εκτελεστούν αξιόπιστα.
Η τεχνολογία της Kardome αντιμετωπίζει κάθε άτομο σαν να είναι ο μόνος που μιλάει στο δωμάτιο. Ποια τεχνική επέκταση καθιστά αυτό δυνατό, και πώς διαφέρει από τις συμβατικές μεθόδους αναγνώρισης φωνής;
Η τεχνική μας επέκταση είναι μια ιδιοκτησιακή τεχνολογία που ονομάζεται Spatial Hearing AI, η οποία υπερβαίνει τις συμβατικές μεθόδους που μόνο ανιχνεύουν την κατεύθυνση ενός ήχου για να καθορίσει την ακριβή τοποθεσία σε τριδιάστατο χώρο. Λειτουργεί αναλύοντας το ολόκληρο μοτίβο ανακλάσεων που μια φωνή δημιουργεί σε ένα δωμάτιο, αντιμετωπίζοντας τον σύνθετο τρόπο που ο ήχος ανακλώνεται από τις επιφάνειες ως μια μοναδική ‘ακουστική αποτύπωση’ για αυτή τη συγκεκριμένη θέση. Ο AI μας ανιχνεύει αμέσως και παθητικά αυτή την αποτύπωση για κάθε πηγή ήχου, χαρτογραφώντας αποτελεσματικά το περιβάλλον. Αυτή η τοποθεσιακή προσέγγιση διαφέρει θεμελιωδώς από τις συμβατικές κατευθύνσεις-οδηγούμενες συστήματα, τα οποία συχνά μπερδεύονται από τις ίδιες τις ανακλάσεις που χρησιμοποιούμε ως πολύτιμα δεδομένα. Ενώ αυτά ακούν μια seule φωνή σαν να ήταν μια πλήθη από ηχούς, η τεχνολογία μας χρησιμοποιεί το ολόκληρο μοτίβο ανακλάσεων για να καθορίσει την πραγματική πηγή. Το πρακτικό αποτέλεσμα είναι ότι μια συσκευή που υποστηρίζεται από την Kardome μπορεί να επικεντρωθεί σε ένα άτομο σε ένα θορυβώδες περιβάλλον και να το ακούσει σαν να μιλούσε μόνος του σε ένα ήσυχο δωμάτιο. Επιπλέον, ο Cognition AI διασφαλίζει ότι το σύστημα δεν μόνο ακούει τις λέξεις αλλά και κατανοεί ποιος τις είπε και τι σημαίνουν στο контέκστ.
Η φωνητική AI λέγεται ότι έχει το ‘iPhone moment’. Από την οπτική σας, τι σημαίνει αυτό, και πόσο κοντά είμαστε στην πραγματική υιοθέτηση από το ευρύ κοινό;
Για μένα, το ‘iPhone moment’ σημαίνει ότι η φωνή είναι τελικά έτοιμη να γίνει ο προεπιλεγμένος τρόπος που αλληλεπιδρούμε με τις υπολογιστικές συσκευές.
Βλέπω τους κατασκευαστές να αγωνίζονται για να ενσωματώσουν τεχνολογίες φωνής AI σε ολόκληρες σειρές προϊόντων. Τα αυτοκίνητα γίνονται διεπαφές φωνής για λόγους ασφαλείας. Τα έξυπνα σπίτια χρειάζονται διεπαφές φωνής επειδή δεν είναι εφικτό να τοποθετηθούν οθόνες αφής παντού. Τα παραδοσιακά ηλεκτρονικά προϊόντα προσθέτουν επίσης ικανότητες φωνής επειδή είναι συχνά ταχύτερα από το να πλοηγηθείς στα μενού. Ενώ πολλές τεχνολογίες οδηγούν την υιοθέτηση της φωνής, η πραγματική επανάσταση θα καθοριστεί από τη ρομποτική. Όταν τα ρομπότ ενταχθούν στα σπίτια και τις εργασίες μας, η φωνή θα αναδυθεί ως η μόνη πραγματικά αποτελεσματική και φυσική διεπαφή για αλληλεπίδραση.
Για αυτή τη συνύπαρξη να είναι ομαλή, τα ρομπότ πρέπει να μας κατανοούν σε ανθρώπινο επίπεδο. Χρειάζονται να κατανοούν το контέκστ και τη νюανς της φυσικής ομιλίας, όχι μόνο τις λέξεις-κλειδιά. Απαιτούν μια χωρική ευαισθησία τόσο ακριβή που να φαίνεται μαγική—αυτόματα γνωρίζοντας ότι εσείς είστε αυτός που μιλάει σε αυτά, ακόμη και σε ένα θορυβώδες δωμάτιο. Κριτικά, αυτή η ευφυΐα πρέπει να λειτουργεί στην άκρη για άμεση, ιδιωτική και αξιόπιστη επικοινωνία.
Αυτό δεν είναι μια τακτική βελτίωση· είναι μια θεμελιώδης μετατόπιση στο πώς οι άνθρωποι και οι μηχανές θα αλληλεπιδράσουν. Κτίζουμε την τεχνολογία για να οδηγήσουμε αυτή τη ανακαίνιση. Θα λέγαμε ότι είμαστε περίπου 24 μήνες μακριά από το σημείο όπου η φωνή θα γίνει η αναμενόμενη διεπαφή και όχι ένα ωραίο να έχει χαρακτηριστικό.
Σε πρακτικούς όρους, πώς βλέπετε την χωρική ακοή και την AI της γνωσίας να μεταμορφώνουν τις καθημερινές συσκευές — από τα αυτοκίνητα και τα έξυπνα σπίτια έως τα wearables και τους δημόσιους χώρους;
Η μεταμόρφωση είναι για να ενεργοποιήσει τη φυσική αλληλεπίδραση όπου και να βρίσκεστε, χωρίς να προσαρμόσετε τη συμπεριφορά σας για να προσαρμοστείτε στην τεχνολογία. Σε αυτοκίνητα, αυτό σημαίνει πραγματικά χειροκίνητο έλεγχο που λειτουργεί ενώ οδηγείτε σε ταχύτητες αυτοκινητόδρομου με μουσική και ομιλητές. Τα έξυπνα σπίτια γίνονται πραγματικά έξυπνα όταν μπορούν να κατανοούν ποιος μιλάει και από πού, χειριζόμενα ταυτόχρονα αιτήματα χωρίς σύγχυση.
Το κλειδί είναι ότι η χωρική ακοή AI δεν βελτιώνει μόνο την αναγνώριση φωνής—ενεργοποιεί εντελώς νέους τρόπους αλληλεπίδρασης. Όταν οι συσκευές μπορούν να κατανοούν ολόκληρη την ακουστική σκηνή, μπορούν να συμμετάσχουν στη φυσική ροή της ανθρώπινης επικοινωνίας, αντί να βασίζονται σε τεχνητά περιορισμούς. Τα wearables γίνονται πολύ πιο χρήσιμα όταν μπορούν να απομονώσουν τη φωνή σας από τις γύρω συνομιλίες, και οι δημόσιοι χώροι μπορούν να προσφέρουν προσωποποιημένη αλλά ιδιωτική βοήθεια φωνής. Όπως αναφέρθηκε για τα ρομπότ, αυτό συνιστά μια θεμελιώδη μετατόπιση στο πώς οι άνθρωποι και οι μηχανές θα αλληλεπιδράσουν με τα ρομπότ που ενταχθούν στη ζωή μας.
Η ιδιωτικότητα είναι μια αυξανόμενη ανησυχία με τις συσκευές που ακούν πάντα. Πώς η Kardome ισορροπεί την απαίτηση για επεξεργασία στην άκρη με την ανάγκη για απόδοση και ακρίβεια;
Η πλειοψηφία των σημερινών λύσεων Voice AI λειτουργεί σε ένα υβριδικό μοντέλο, αποτελούμενο από ένα στοιχείο στην άκρη (πériphérique) και ένα στοιχείο βασισμένο στο cloud. Ενώ η επεξεργασία στην άκρη δεν προκαλεί προβλήματα ιδιωτικότητας, επειδή τα δεδομένα δεν εγκαταλείπουν την συσκευή του χρήστη, η επεξεργασία στο cloud παρουσιάζει μια σημαντική πρόκληση για την ιδιωτικότητα των δεδομένων.
Η Kardome αντιμετωπίζει αυτή την πρόκληση επεκτείνοντας σημαντικά τις ικανότητες του στοιχείου στην άκρη. Βελτιώνοντας την επεξεργασία δεδομένων τοπικά και μειώνοντας την εξάρτηση από το cloud, η Kardome διασφαλίζει ότι ευαίσθητα δεδομένα φωνής δεν εγκαταλείπουν ποτέ τη συσκευή, προσφέροντας ανώτερη προστασία ιδιωτικότητας σε σύγκριση με άλλα συστήματα στην αγορά.
Ένα σημαντικό πρόβλημα με τις “πάντα ακούγοντας” συσκευές δεν είναι το μικρόφωνο που καταγράφει ήχο, αλλά ο κίνδυνος ότι αυτός ο ήχος ανεβαίνει στο cloud για ανάλυση. Στην πράξη, το απαγορευτικό κόστος της συνεχούς επεξεργασίας στο cloud σημαίνει ότι τα περισσότερα εμπορικά συστήματα αποφεύγουν αυτό, αλλά αυτό έρχεται με το τίμημα μιας χαμηλότερης ποιότητας και λιγότερο ανταποκρικτικής Διεπαφής Φωνής.
Η Kardome λύνει αυτή την ανταλλαγή με το να φέρει ισχυρά, πάντα-ενεργά μοντέλα γλωσσών στην ίδια τη συσκευή. Με την τεχνολογία μας, η ακουστική σκηνή, η φυσική ομιλία και ο контέκστ αναλύονται σε πραγματικό χρόνο απευθείας στη συσκευή. Δεν ανεβαίνει ποτέ δεδομένα φωνής. Αυτή η καινοτόμος προσέγγιση μας επιτρέπει να προσφέρουμε και την ανώτερη προστασία ιδιωτικότητας και μια υψηλής απόδοσης Διεπαφή Φωνής, εξαλείφοντας το συμβιβασμό που αντιμετωπίζουν οι χρήστες σήμερα.
Κοιτάζοντας την βιομηχανία πιο ευρύτερα, ποια είναι τα μεγαλύτερα εμπόδια που η φωνητική AI πρέπει ακόμη να υπερβεί πριν γίνει η κυρίαρχη διεπαφή σε ολόκληρη την καταναλωτική ηλεκτρονική;
Το μεγαλύτερο εμπόδιο είναι ότι η φωνητική AI δεν επικοινωνεί ακόμη σαν οι άνθρωποι. Μέχρι η φωνητική AI να μπορέσει να ακούσει και να κατανοήσει σαν οι άνθρωποι, με πλήρη επίγνωση контέκστ και ικανότητα να κατανοήσει τη ροή της συνομιλίας, δεν θα γίνει η πρωταρχική διεπαφή που οι άνθρωποι θέλουν να είναι. Ένα σημαντικό τεχνικό εμπόδιο σε αυτό το σημείο είναι ότι η πλειοψηφία της τεχνολογίας φωνής AI είναι βασισμένη στο cloud. Αυτό εμποδίζει φυσικά την συνεχή ακρόαση και εμποδίζει την κατανόηση της ροής της συνομιλίας.
Η επέκταση θα έρθει όταν τα συστήματα φωνής μπορέσουν πραγματικά να κατανοήσουν τον контέκστ της συνομιλίας και να απαντήσουν με την ίδια ενστικτώδη επίγνωση που έχουν οι άνθρωποι. Αυτό είναι όταν η φωνή θα γίνει η κυρίαρχη διεπαφή σε όλες τις καταναλωτικές ηλεκτρονικές συσκευές.
Πώς νομίζετε ότι η σχέση των καταναλωτών με τους βοηθούς φωνής θα εξελιχθεί όταν η ακρίβεια και η αξιοπιστία σε θορυβώδεις περιβάλλοντα λυθούν;
Όταν η αξιοπιστία και η φυσική συνομιλία λυθούν, οι βοηθοί φωνής θα μετατραπούν από νέα χαρακτηριστικά σε απαραίτητες διεπαφές που οι άνθρωποι εξαρτώνται από αυτές καθ’ όλη τη διάρκεια της ημέρας. Όταν οι άνθρωποι ξέρουν ότι η φωνητική AI θα κατανοήσει σωστά τις πρώτες φορές, ακόμη και σε απαιτητικά περιβάλλοντα, θα σταματήσουν να προσαρμόζονται στην τεχνολογία και θα αρχίσουν να τη χρησιμοποιούν ενστικτωδώς με φυσική γλώσσα και συνομιλίες контέκστ.
Το μέλλον της φωνητικής αλληλεπίδρασης θα είναι προβλέψιμο και προδραστικό. Φανταστείτε τη συσκευή σας να κατανοεί όχι μόνο τις λέξεις σας, αλλά και τον τόνο, τις συναισθηματικές ενδείξεις και το υποκείμενο της συνομιλίας. Τα τρέχοντα συστήματα δυσκολεύονται με το φυσικό ρυθμό της συνομιλίας και δεν μπορούν να χειριστούν διακοπές, εναλλαγή και κατανόηση контέκστ. Οι άνθρωποι προσαρμόζονται όταν διακοπούνται· η φωνητική AI συχνά μπερδεύεται. Για τους OEM, η πρόκληση είναι η ενσωμάτωση φωνητικής AI που μπορεί να προσφέρει αυτή τη μελλοντική διεπαφή χωρίς την πολυπλοκότητα και τις απαιτήσεις υλικού των σημερινών λύσεων.
Τέλος, πού βλέπετε την Kardome και το οικοσύστημα φωνής AI πέντε χρόνια από τώρα, και ποια ορόσημα θα καθορίσουν εάν έχουμε πραγματικά εισέλθει στην εποχή της φωνητικής πρώτης υπολογιστικής;
Πέντε χρόνια από τώρα, η φωνητική AI θα είναι τόσο πανταχού παρούσα όσο οι οθόνες αφής και τα πληκτρολόγια είναι σήμερα, και θα αναμένεται σχεδόν σε κάθε υπολογιστική συσκευή. Η Kardome θα είναι το λειτουργικό σύστημα που θα επιτρέψει στους χρήστες να ελέγχουν τις συσκευές τους με φωνή, ενεργοποιώντας τη φυσική αλληλεπίδραση με οποιαδήποτε συσκευή σε οποιοδήποτε περιβάλλον, από ρομπότ έως έξυπνα γυαλιά, από αυτοκίνητα έως δημόσιους χώρους.
Τα ορόσημα θα είναι συμπεριφορικά παρά τεχνικά. Θα γνωρίζουμε ότι έχουμε επιτύχει την φωνητική πρώτη υπολογιστική όταν οι άνθρωποι σταματήσουν να σκέφτονται για εντολές φωνής και αρχίσουν να έχουν φυσικές συνομιλίες με το περιβάλλον τους, όταν οι περιβάλλοντες με πολλούς χρήστες λειτουργούν ομαλά, και όταν τα παιδιά μεγαλώνουν αναμένοντας να μιλήσουν σε οποιαδήποτε συσκευή φυσικά. Το τελικό μέτρο δεν θα είναι πόσο σοφιστική γίνεται η τεχνολογία μας, αλλά πόσο φυσικά οι άνθρωποι αλληλεπιδρούν με τον ψηφιακό κόσμο.
Ευχαριστούμε για τη μεγάλη συνέντευξη, οι αναγνώστες που θέλουν να μάθουν περισσότερα πρέπει να επισκεφθούν την Kardome.












