Інтерв’ю

Дані Херкаскі, генеральний директор і співзасновник Kardome – Серія інтерв’ю

mm
Додайте Unite.AI до бажаних джерел у Google

Дані Херкаскі, генеральний директор і співзасновник Kardome, має понад два десятиліття досвіду в галузі акустики, обробки сигналів і розробки алгоритмів, які він застосовує для інновацій у сфері технологій голосового управління. До заснування Kardome він обіймав посаду технічного директора в компанії Silentium Ltd., де керував дослідженнями та розробками спільно з компаніями першого рівня та науковими установами. Дані Херкаскі має докторський ступінь у галузі обробки мікрофонних масивів в університеті Бар-Ілан, і він поєднує глибокі технічні знання з чіткою місією — усунути розчарування сучасного голосового управління, створивши технологію, яка真正но слухає людей, а не шум довкола них.

Kardome є піонером у сфері розробки AI-драйвених рішень для просторового слуху, які забезпечують чітке та персоналізоване голосове взаємодіяння в будь-якому середовищі — від автомобілів і конференц-залів до розумних будинків і громадських просторів. Їхня власна технологія кластеризації мовлення розрізняє голоси за місцем їх походження, дозволяючи пристроям розуміти кожного мовця так, якби він був єдиним, хто говорить. Розроблена як апаратно-незалежна та готовая до роботи на краю мережі, платформа Kardome підвищує точність розпізнавання мовлення, безпеку та досвід користувача, забезпечуючи наступне покоління взаємодії людини та машини.

Що надихнуло вас і доктора Алона Слапака заснувати Kardome?

Ідея створення Kardome виникла з поєднання захоплення та розчарування. З нашим досвідом у сфері мовлення та аудіо, як в академії, так і в промисловості, ми були вражені прогресом у розпізнаванні мовлення, особливо коли з’явилися глибокі нейронні мережі.

У тихій лабораторії технологія була феноменальною. Але як тільки ви виходили у реальний світ, ця магія зникала. Ми спостерігали, що в шумному автомобілі, зайнятому офісі чи хаотичному будинку, навіть найсучасніші системи були мало кращі за технологію 1990-х років. Це було великим бар’єром для прогресу.

Голос є найнатуральнішим способом взаємодії з нашими пристроями, справжнім наступником сенсорних екранів. Але для цього технологія повинна була подолати хаос реального життя. Ми вирішили зробити це нашою місією. Ми провели рік у гаражі, борючись з рівняннями поширення звукових хвиль та тестуванням нових ідей, поки не досягли прориву: першої демонстрації того, що зараз відомо як технологія просторового слуху Kardome.

У той момент ми знали, що маємо ключ. Ми заснували Kardome не лише для створення продукту, а для початку революції у сфері взаємодії людини та машини.

Чому традиційні методи голосового управління часто не справляються з ситуаціями, коли голоси перекриваються чи фоновий шум домінує?

Традиційні інтерфейси голосового управління працюють погано в реальному світі, оскільки їхнє програмне забезпечення використовує надто простий метод для розуміння звуку. Більшість систем використовують кілька мікрофонів для визначення напрямку прибуття звуку, підхід, який фокусується лише на куті звуку, ігноруючи інші важливі просторові дані. Цей метод негайно припиняє працювати в будь-якому реальному середовищі — як у автомобілі, офісі чи житловій кімнаті — оскільки ці середовища наповнені реверберацією, де звукові хвилі відбиваються від кожної відбиваючої поверхні. Для системи, яка розуміє лише напрям, кожне з цих відбитих відблисків сприймається як новий звук з іншого місця.

Це створює дезорієнтуючий ефект, якби пристрій був у залі “акустичних дзеркал”, де один голос здається, що йде з сотень напрямків одночасно. Нездатність розрізняти окремі голоси мовців від шторму відблисків, система не може належним чином розшифрувати звуковий пейзаж. Це фундаментальне обмеження є причиною, чому сучасні технології голосового управління мають таку погану сприйняття аудіо в реальних, хаотичних сценаріях і в кінцевому підсумку не можуть працювати надійно.

Яка технічна інновація дозволяє технологіям Kardome розглядати кожного людини як єдиного мовця в кімнаті?

Наша технічна інновація полягає у власній технології під назвою Просторовий Слух AI, яка перевершує традиційні методи, які лише визначають напрямок звуку, а натомість точно визначає його місце у тривимірному просторі. Вона працює шляхом аналізу всього відбитого шаблону, який створює голос у кімнаті,扱уючи складний спосіб, яким звук відбивається від поверхонь, як унікальний “акустичний відбиток” для цього конкретного положення. Наш AI миттєво та пасивно витягує цей відбиток для кожного джерела звуку, ефективно картографуючи середовище. Цей підхід, заснований на місці, фундаментально відрізняється від традиційних систем, які легко плутаються цими самими відблисками, які ми використовуємо як цінні дані. Коли вони чують одного мовця як натовп відблисків, наша технологія використовує весь відбитий шаблон для визначення фактичного джерела. Практичний результат полягає в тому, що пристрій, оснащений технологією Kardome, може зосередитися на одному людині в шумному середовищі та чути його так, якби він говорив один у тихій кімнаті. Крім того, Когнітивний AI забезпечує, щоб система не лише чула слова, але й розуміла, хто їх сказав і що вони означають у контексті.

Голосовий AI, як кажуть, переживає свій “момент айфона”. Що це означає з вашої точки зору, і наскільки ми близькі до真正ної масової адоптації?

Для мене “момент айфона” означає, що голос нарешті готовий стати основним способом взаємодії з обчислювальними пристроями.

Я бачу, як виробники переносять технології голосового AI по всім своїм продуктам. Автомобілі стають голосовими інтерфейсами з причин безпеки. Розумні будинки потребують голосових інтерфейсів, оскільки неможливо встановити сенсорні екрани всюди. Традиційна електроніка також додає голосові можливості, оскільки це часто швидше, ніж навігація по меню. Хоча багато технологій сприяють адоптації голосу,真正на революція буде диктуватися робототехнікою. Коли роботи інтегруються у наші домівки та робочі місця, голос вийде як єдиний真正но ефективний та природний інтерфейс для взаємодії.

Для цього безшовного співіснування роботам потрібно розуміти нас на людському рівні. їм потрібно зрозуміти контекст та нюанси природної мови, а не лише ключові слова. їм потрібна просторова свідомість така точна, що здається магічною — інтуїтивно знаючи, що саме ви говорите з ними, навіть у шумному приміщенні. Критично, ця інтелект повинна працювати на краю для миттєвого, приватного та надійного спілкування.

Це не інкрементальне покращення; це фундаментальний зсув у тому, як люди та машини будуть взаємодіяти. Ми будуємо технологію для керівництва цим переозначенням. Я б сказав, що ми приблизно за 24 місяці від точки інфлексії, де голос стане очікуваним інтерфейсом, а не просто приємною особливістю.

Як ви бачите, що просторовий слух і когнітивний AI перетворять повсякденні пристрої — від автомобілів і розумних будинків до носимих пристроїв і громадських просторів?

Перетворення полягає у тому, щоб забезпечити природну взаємодію будь-де, без необхідності адаптувати свою поведінку для пристроїв. В автомобілях це означає真正но безрукавне керування, яке працює під час руху з високою швидкістю з музикою та пасажирами, які розмовляють. Розумні будинки стають真正но розумними, коли вони можуть зрозуміти, хто говорить і з якого місця, обробляючи одночасні запити без плутанини.

Ключовий висновок полягає в тому, що просторовий слух AI не лише покращує розпізнавання мовлення, а й дозволяє створити зовсім нові парадигми взаємодії. Коли пристрої можуть зрозуміти весь звуковий пейзаж, вони можуть брати участь у природному потоці людської комунікації, а не покладатися на штучні обмеження. Носимі пристрої стають значно кориснішими, коли вони можуть ізолювати ваш голос від навколишніх розмов, а громадські простори можуть пропонувати персоналізовану, але приватну голосову допомогу. Як уже згадувалося для робототехніки, це становить фундаментальний зсув у тому, як люди та машини будуть взаємодіяти з роботами, які інтегруються у нашу життя.

Як Kardome балансує вимоги до обробки на пристрої з необхідністю продуктивності та точності?

Більшість сучасних рішень голосового AI працюють на гібридній моделі, яка складається з компонента на пристрої (краю) та компонента, заснованого на хмарі. Хоча обробка на пристрої не становить проблем для конфіденційності, оскільки дані ніколи не покидають пристрій користувача, обробка у хмарі представляє значний виклик для захисту даних.

Kardome відповідає на цей виклик, значно розширюючи можливості компонента на пристрої. Збільшуючи кількість даних, які обробляються локально, та зменшуючи залежність від хмари, Kardome забезпечує, щоб конфіденційні голосові дані ніколи не залишали пристрій, пропонуючи кращий захист приватності порівняно з іншими системами на ринку.

Одна з найбільших проблем з “завжди-слухаючими” пристроями не полягає в тому, що мікрофон захоплює аудіо, а в ризику того, що це аудіо буде завантажено у хмару для аналізу. На практиці заборонна вартість безперервної обробки у хмарі означає, що більшість комерційних систем уникатимуть цього, але це відбувається за високою ціною: нижчої якості та менш реагуючої голосової системи.

Kardome вирішує цей компроміс, привнося потужні, завжди-включені моделі мови на сам пристрій. З нашою технологією акустична сцена, природна мова та контекст аналізуються в реальному часі безпосередньо на пристрої. Жодні голосові дані ніколи не завантажуються чи зберігаються. Цей інноваційний підхід дозволяє Kardome забезпечити як сильний захист приватності даних, так і високу ефективність голосового інтерфейсу, усунувши компроміс, з яким зараз стикаються користувачі.

Як ви бачите Kardome і екосистему голосового AI через п’ять років, і які вехи визначать, чи真正но ми увійшли у добу голосової першості?

Через п’ять років голосовий AI буде так само повсюдним, як сенсорні екрани та клавіатури сьогодні, і його очікуватимуть у майже кожному обчислювальному пристрої. Kardome стане операційною системою, яка дозволить користувачам керувати своїми пристроями голосом, забезпечуючи природну взаємодію з будь-яким пристроєм у будь-якому середовищі, від роботів до розумних окулярів, автомобілів.

Визначальними вехами будуть поведінкові, а не технологічні. Ми знатимемо, що досягли голосової першості, коли люди перестануть думати про голосові команди та почнуть мати природні розмови зі своїм оточенням, коли багатомовні середовища працюватимуть безшовно, і коли діти виростуть, очікуючи говорити з будь-яким пристроєм природно. Останнім мірилом не буде те, наскільки нашу технологію можна вдосконалити, а те, наскільки природно люди взаємодіятимуть з цифровим світом.

Дякуємо за велике інтерв’ю. Читачам, які бажають дізнатися більше, рекомендуємо відвідати Kardome.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.