Интервью

Дани Черкасский, генеральный директор и сооснователь Kardome – Интервью

mm
Добавьте Unite.AI в избранные источники в Google

Дани Черкасский, генеральный директор и сооснователь Kardome, имеет более двух десятилетий опыта в области акустики, обработки сигналов и разработки алгоритмов, который он привносит в инновации голосовых технологий. До основания Kardome он занимал должность технического директора в компании Silentium Ltd., где возглавлял исследования и разработки в сотрудничестве с компаниями первого уровня и исследовательскими учреждениями. Обладая докторской степенью в области обработки массивов микрофонов в Университете Бар-Илана, Черкасский сочетает глубокую техническую экспертизу с четкой миссией – устранить разочарования современного голосового взаимодействия, создавая технологии, которые действительно слушают людей, а не шум вокруг них.

Kardome является пионером в области AI-решений для пространственного слуха, которые обеспечивают четкое, персонализированное голосовое взаимодействие в любой среде – от автомобилей и конференц-залов до умных домов и общественных пространств. Своя проприетарная технология кластеризации речи разделяет голоса на основе местоположения, позволяя устройствам понимать каждого говорящего как если бы он был единственным человеком, говорящим. Разработанная как аппаратно-независимая и готовая к использованию на краю сети, платформа Kardome повышает точность распознавания речи, безопасность и пользовательский опыт, обеспечивая следующее поколение взаимодействия человека и машины.

Что вдохновило вас и доктора Алона Слапака на основание Kardome?

Идея создания Kardome возникла из сочетания fascinations и разочарования. С нашим опытом в области речи и аудио, как в академии, так и в промышленности, мы были в восторге от прогресса в распознавании речи, особенно когда глубокие нейронные сети вошли в сцену.

В тихой лаборатории технология была феноменальной. Но как только вы выходили в реальный мир, эта магия исчезала. Мы наблюдали, что в шумной машине, офисе или хаотичном доме, передовые системы были едва лучше технологий 1990-х годов. Это было большим барьером на пути к прогрессу.

Голос является наиболее естественным способом взаимодействия с нашими устройствами, истинным преемником сенсорного экрана. Но для этого технология должна была преодолеть хаос реальной жизни. Мы решили сделать это нашей миссией. Мы провели год в гараже, борясь с уравнениями распространения звуковых волн и тестируя новые идеи, пока не достигли прорыва: первую демонстрацию того, что теперь известно как технология пространственного слуха Kardome.

В тот момент мы знали, что у нас есть ключ. Мы основали Kardome не только для создания продукта, но и для начала революции в том, как люди и машины общаются.

Многие голосовые помощники испытывают трудности и часто разочаровывают пользователей, когда голоса перекрываются или фоновый шум берет верх. Почему традиционные методы работают так плохо в этих реальных условиях?

Традиционные голосовые интерфейсы работают плохо в реальном мире, потому что их программное обеспечение полагается на чрезвычайно упрощенный метод понимания звука. Большинство систем используют несколько микрофонов для определения направления прихода звука, подход, который фокусируется только на угле звука, игнорируя другие важные 3D-пространственные данные. Этот метод сразу же терпит неудачу в любой реальной обстановке – например, в машине, офисе или гостиной – потому что эти среды заполнены реверберацией, где звуковые волны отражаются от каждой отражающей поверхности. Для системы, которая понимает только направление, каждое из этих отражений воспринимается как новый звук из другого местоположения.

Это создает дезориентирующий эффект, как если бы устройство было в зале “акустических зеркал”, где один голос кажется исходящим из сотен направлений одновременно. Не в состоянии различать отдельные голоса говорящих от шторма отражений, система не может правильно расшифровать звуковой пейзаж. Это фундаментальное ограничение является именно той причиной, по которой текущие голосовые технологии имеют такое плохое восприятие аудио в реальных, хаотических сценариях и в конечном итоге терпят неудачу в надежной работе.

Технологии Kardome рассматривают каждого человека как если бы он был единственным человеком, говорящим в комнате. Какой технический прорыв делает это возможным, и как он отличается от традиционных методов распознавания голоса на расстоянии?

Наш технический прорыв – это проприетарная технология под названием Spatial Hearing AI, которая превосходит традиционные методы, которые обнаруживают только направление звука, а вместо этого определяет его точное местоположение в трехмерном пространстве. Она работает путем анализа всего отраженного узора, созданного голосом в комнате, рассматривая сложный способ, которым звук отражается от поверхностей, как уникальную “акустическую отпечаток” для этого конкретного местоположения. Наша ИИ мгновенно и пассивно выводит этот отпечаток для каждого источника звука, эффективно картографируя среду. Этот подход, основанный на местоположении, фундаментально отличается от традиционных систем, которые легко путаются этими же отражениями, которые мы используем как ценные данные. Пока они слышат одного говорящего как толпу эхо, наша технология использует полный отраженный узор для определения фактического источника. Практический результат заключается в том, что устройство, оснащенное Kardome, может сосредоточиться на одном человеке в шумной среде и услышать его так, как если бы он говорил один в тихой комнате. Кроме того, ИИ-понимание обеспечивает, что система не только слышит слова, но и понимает, кто сказал их и что они значат в контексте.

Голосовой ИИ, как говорят, переживает свой “момент айфона”. Что это значит с вашей точки зрения, и насколько близко мы к真正шему массовому внедрению?

Для меня “момент айфона” означает, что голос наконец готов стать основным способом взаимодействия с вычислительными устройствами.

Я вижу, как производители спешат интегрировать технологии голосового ИИ во все свои линии продукции. Автомобили становятся голосовыми интерфейсами по причинам безопасности. Умные дома нуждаются в голосовых интерфейсах пользователя, потому что невозможно установить сенсорные экраны повсюду. Традиционная электроника также добавляет голосовые возможности, потому что это часто быстрее, чем навигация по меню. Хотя многие технологии стимулируют внедрение голоса,真正я революция будет диктоваться робототехникой. Когда роботы интегрируются в наши дома и рабочие места, голос станет единственным действительно эффективным и естественным интерфейсом для взаимодействия.

Для того чтобы это сосуществование было безупречным, роботы должны понимать нас на человеческом уровне. Им нужно понимать контекст и нюансы естественной речи, а не только ключевые слова. Им требуется пространственное осознание, настолько точное, что кажется магическим – интуитивно зная, что вы говорите им, даже в шумной комнате. Критически важно, что эта интеллект должна работать на краю для мгновенного, частного и надежного общения.

Это не инкрементальное улучшение; это фундаментальный сдвиг в том, как люди и машины будут взаимодействовать. Мы строим технологию, чтобы возглавить это переопределение. Я бы сказал, что мы находимся примерно в 24 месяцах от точки перегиба, где голос станет ожидаемым интерфейсом, а не приятной функцией.

В практическом смысле, как вы видите пространственный слух и когнитивный ИИ, превращающие повседневные устройства – от автомобилей и умных домов до носимых устройств и общественных пространств?

Преобразование заключается в том, чтобы обеспечить естественное взаимодействие, где бы вы ни находились, без необходимости адаптировать свое поведение, чтобы приспособиться к технологии. В автомобилях это означает真正 бесплатное управление, которое работает во время вождения на шоссе с включенной музыкой и говорящими пассажирами. Умные дома становятся действительно интеллектуальными, когда они могут понять, кто говорит и откуда, обрабатывая одновременные запросы без путаницы.

Ключевое прозрение заключается в том, что пространственный слух ИИ не только улучшает распознавание голоса, но и позволяет создавать совершенно новые парадигмы взаимодействия. Когда устройства могут понять весь акустический пейзаж, они могут участвовать в естественном потоке человеческого общения, а не полагаться на искусственные ограничения. Носимые устройства становятся намного более полезными, когда они могут выделить ваш голос из окружающих разговоров, а общественные пространства могут предложить персонализированную, но частную голосовую помощь. Как упоминалось ранее для робототехники, это представляет собой фундаментальный сдвиг в том, как люди и машины будут взаимодействовать с роботами, интегрированными в нашу жизнь.

Приватность является все более растущей проблемой с устройствами, которые всегда слушают. Как Kardome балансирует спрос на обработку на устройстве с необходимостью производительности и точности?

Большинство современных решений голосового ИИ работают на гибридной модели, состоящей из компонента на устройстве (крае) и компонента, основанного на облаке. Хотя обработка на крае не представляет никаких проблем с приватностью, поскольку данные никогда не покидают устройство пользователя, обработка в облаке представляет значительную проблему для приватности данных.

Kardome решает эту проблему, значительно расширяя возможности компонента на устройстве. Обрабатывая больше данных локально и снижая зависимость от облака, Kardome обеспечивает, что конфиденциальные голосовые данные никогда не покидают устройство, предлагая лучшую защиту приватности по сравнению с другими системами на рынке.

Основной проблемой с “устройствами, которые всегда слушают”, не является то, что микрофон захватывает аудио, а скорее риск того, что это аудио будет загружено в облако для анализа. На практике запретительная стоимость постоянной обработки в облаке означает, что большинство коммерческих систем избегают этого, но это происходит за счет более низкого качества и менее отзывчивого голосового интерфейса.

Kardome решает этот компромисс, привнося мощные, всегда включенные языковые модели на само устройство. С нашей технологией акустический пейзаж, естественная речь и контекст анализируются в реальном времени прямо на устройстве. Никакие голосовые данные никогда не загружаются или сохраняются. Этот инновационный подход позволяет Kardome обеспечить как надежную защиту приватности данных, так и высокоэффективный голосовой интерфейс, устраняя компромисс, с которым пользователи сейчас сталкиваются.

Посмотрев на отрасль в целом, какие являются самыми большими препятствиями, которые голосовой ИИ еще должен преодолеть, прежде чем он станет доминирующим интерфейсом во всей потребительской электронике?

Самым большим препятствием является то, что голосовой ИИ еще не общается как люди. До тех пор, пока голосовой ИИ не сможет слышать и понимать как люди, с полным осознанием контекста и способностью понимать поток разговора, он не станет основным интерфейсом, которым люди хотят, чтобы он был. Значительным техническим препятствием на этом этапе является то, что большинство технологий голосового ИИ основано на облаке. Это внутренне препятствует непрерывному прослушиванию и, следовательно, блокирует понимание потока разговора.

Прорыв будет тогда, когда голосовые системы смогут действительно понимать контекст разговора и реагировать с той же интуитивной осведомленностью, которую имеют люди. Тогда голос станет доминирующим интерфейсом во всей потребительской электронике.

Как вы думаете, как будет развиваться отношение потребителей к голосовым помощникам, когда будут решены проблемы точности и надежности в шумной среде?

Когда будут решены надежность и естественный разговор, голосовые помощники перейдут от новинок к необходимым интерфейсам, на которые люди полагаются на протяжении всего дня. Когда люди знают, что голосовой ИИ поймет их правильно с первого раза, даже в сложных средах, они перестанут приспосабливаться к технологии и начнут использовать ее интуитивно с естественным языком и контекстными разговорами.

Будущее голосового взаимодействия будет прогностическим и проактивным. Представьте, что ваше устройство понимает не только ваши слова, но и ваш тон, эмоциональные сигналы и подtekst разговора. Текущие системы испытывают трудности с естественным ритмом разговора и не могут справиться с прерываниями, чередованием и контекстным пониманием. Люди адаптируются, когда их прерывают; голосовой ИИ часто путается. Для OEM-производителей задача заключается в интеграции голосового ИИ, который может обеспечить этот будущий интерфейс без сложности и требований к аппаратному обеспечению современных решений.

Наконец, где вы видите Kardome и экосистему голосового ИИ через пять лет, и какие вехи определят, действительно ли мы вошли в эпоху голосового первичного вычисления?

Через пять лет голосовой ИИ будет таким же повсеместным, как сенсорные экраны и клавиатуры сегодня, и он будет ожидаем в практически каждом вычислительном устройстве. Kardome будет операционной системой, которая позволит пользователям управлять своими устройствами голосом, обеспечивая естественное взаимодействие с любым устройством в любой среде – от роботов до умных очков, автомобилей.

Определяющие вехи будут поведенческими, а не технологическими. Мы будем знать, что достигли голосового первичного вычисления, когда люди перестанут думать о голосовых командах и начнут вести естественные разговоры со своей средой, когда многоуровневые среды будут работать безупречно, и когда дети вырастут, ожидая, что смогут говорить с любым устройством естественно. Окончательная мера не будет заключаться в том, насколько совершенной становится наша технология, а в том, насколько естественно люди взаимодействуют с цифровым миром.

Спасибо за отличное интервью, читатели, которые хотят узнать больше, должны посетить Kardome.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.