Entrevistas

Dani Cherkassky, CEO y cofundador de Kardome – Serie de entrevistas

mm
Añade Unite.AI a tus fuentes preferidas en Google

Dani Cherkassky, CEO y cofundador de Kardome, aporta más de dos décadas de experiencia en acústica, procesamiento de señales y desarrollo de algoritmos a la vanguardia de la innovación en tecnología de voz. Antes de fundar Kardome, se desempeñó como CTO en Silentium Ltd., donde lideró colaboraciones de I+D con empresas de nivel 1 y instituciones de investigación. Con un doctorado en Procesamiento de Matrices de Micrófonos de la Universidad Bar-Ilan, Cherkassky combina una profunda experiencia técnica con una misión clara: eliminar las frustraciones de la interacción de voz moderna creando tecnología que realmente escuche a las personas, no al ruido que las rodea.

Kardome es pionera en soluciones de audición espacial impulsadas por IA que brindan interacciones de voz personalizadas y claras en cualquier entorno, desde coches y salas de conferencias hasta hogares inteligentes y espacios públicos. Su tecnología de agrupación de habla por ubicación separa las voces en función de la ubicación, lo que permite a los dispositivos entender a cada hablante como si fuera la única persona que habla. Diseñada para ser agnóstica de hardware y lista para ejecutarse en el borde, la plataforma de Kardome mejora la precisión del reconocimiento de habla, la seguridad y la experiencia del usuario, impulsando la próxima generación de comunicación entre humanos y máquinas.

¿Qué te inspiró a ti y al Dr. Alon Slapak a cofundar Kardome?

La inspiración para Kardome surgió de una combinación de fascinación y frustración. Con nuestros antecedentes en habla y audio, tanto en la academia como en la industria, nos entusiasmaba el progreso en el reconocimiento de habla, particularmente cuando las redes neuronales profundas entraron en escena.

En un laboratorio tranquilo, la tecnología era fenomenal. Pero en el momento en que salías al mundo real, esa magia desaparecía. Observamos que en un coche ruidoso, una oficina ocupada o un hogar caótico, los sistemas avanzados de vanguardia apenas eran mejores que la tecnología de la década de 1990. Este era el gran obstáculo para el progreso.

La voz es la forma más natural de interactuar con nuestros dispositivos, el verdadero sucesor de la pantalla táctil. Pero para que eso suceda, la tecnología necesitaba superar el caos de la vida real. Decidimos hacer de eso nuestra misión. Pasamos un año en el garaje, luchando con ecuaciones de propagación de ondas sonoras y probando nuevas ideas, hasta que logramos un avance: la primera demostración de lo que ahora se conoce como la Tecnología de Audición Espacial de Kardome.

En ese momento, supimos que teníamos la clave. Fundamos Kardome no solo para construir un producto, sino para iniciar una revolución en la forma en que las personas y las máquinas se comunican.

Muchos asistentes de voz tienen dificultades y a menudo frustran a los usuarios cuando las voces se superponen o el ruido de fondo se apodera. ¿Por qué los métodos convencionales funcionan tan mal en estas condiciones del mundo real?

Las interfaces de voz convencionales funcionan mal en el mundo real porque su software se basa en un método demasiado simplista para entender el sonido. La mayoría de los sistemas utilizan varios micrófonos para determinar la dirección de llegada de un sonido, un enfoque que se centra solo en el ángulo de un sonido mientras ignora otra información espacial crucial en 3D. Este método falla inmediatamente en cualquier entorno del mundo real, como un coche, una oficina o una sala de estar, porque estos entornos están llenos de reverberación, donde las ondas sonoras rebota en cada superficie reflectante. Para un sistema que solo entiende la dirección, cada una de estas reflexiones es percibida como un nuevo sonido desde una ubicación diferente.

Esto crea un efecto desorientador, como si el dispositivo estuviera en un salón de “espejos acústicos”, donde una sola voz parece provenir de cientos de direcciones simultáneamente. Incapaz de distinguir las voces distintas de los hablantes del torbellino de reflexiones, el sistema no puede decodificar adecuadamente el paisaje sonoro. Esta limitación fundamental es precisamente por qué las tecnologías de voz actuales tienen una percepción tan pobre del audio en escenarios caóticos del mundo real y, en última instancia, fallan al funcionar de manera confiable.

Las tecnologías de Kardome tratan a cada persona como si fuera la única que habla en la habitación. ¿Qué avance técnico hace posible esto, y cómo se diferencia de la reconocimiento de voz de campo lejano convencional?

Nuestro avance técnico es una tecnología patentada llamada Audición Espacial AI, que supera los métodos convencionales que solo detectan la dirección de un sonido para, en cambio, determinar su ubicación precisa en el espacio tridimensional. Funciona analizando el patrón de reflexión completo que una voz crea dentro de una habitación, tratando la forma compleja en que el sonido rebota en las superficies como una “huella dactilar acústica” única para esa posición específica. Nuestro AI infiere instantáneamente y de forma pasiva esta huella para cada fuente de sonido, efectivamente mapeando el entorno. Este enfoque basado en la ubicación es fundamentalmente diferente de los sistemas convencionales impulsados por la dirección, que se confunden fácilmente por las mismas reflexiones que nosotros utilizamos como datos valiosos. Mientras que ellos escuchan a un solo hablante como una multitud de ecos, nuestra tecnología utiliza el patrón de reflexión completo para determinar la fuente real. El resultado práctico es que un dispositivo habilitado por Kardome puede centrarse en una persona en un entorno ruidoso y escucharla como si estuviera hablando sola en una habitación tranquila. Además, la IA de Cognición garantiza que el sistema no solo escuche las palabras, sino que también entienda quién las dijo y qué significan en contexto.

Se dice que la IA de voz está teniendo su “momento iPhone”. Desde tu perspectiva, ¿qué significa eso, y qué tan cerca estamos de una adopción mainstream real?

Para mí, el “momento iPhone” significa que la voz finalmente está lista para convertirse en la forma predeterminada de interactuar con dispositivos computacionales.

Veamos a los fabricantes compitiendo para integrar tecnologías de IA de voz en toda su gama de productos. Los coches se están convirtiendo en interfaces de voz en primer lugar por razones de seguridad. Los hogares inteligentes necesitan interfaces de usuario de voz porque no es factible colocar pantallas táctiles en todas partes. La electrónica tradicional también está agregando capacidades de voz porque a menudo es más rápido que navegar por menús. Mientras que muchas tecnologías impulsan la adopción de la voz, la verdadera revolución será dictada por la robótica. A medida que los robots se integran en nuestros hogares y lugares de trabajo, la voz surgirá como la única interfaz verdaderamente efectiva y natural para la interacción.

Para que esta coexistencia sea fluida, los robots deben entender a los humanos a un nivel humano. Necesitan comprender el contexto y la sutileza del lenguaje natural, no solo palabras clave. Requieren una conciencia espacial tan precisa que parezca mágica: saber instintivamente que eres quien les habla, incluso en una habitación ruidosa. Críticamente, esta inteligencia debe operar en el borde para una comunicación instantánea, privada y confiable.

Esto no es una mejora incremental; es un cambio fundamental en la forma en que los humanos y las máquinas interactuarán. Estamos construyendo la tecnología para liderar esa redefinición. Diría que estamos a unos 24 meses del punto de inflexión en el que la voz se convertirá en la interfaz esperada en lugar de una característica agradable.

En términos prácticos, ¿cómo ves que la audición espacial y la IA de cognición transformarán dispositivos cotidianos, desde coches y hogares inteligentes hasta dispositivos portátiles y espacios públicos?

La transformación se trata de permitir una interacción natural en cualquier lugar, sin que debas adaptar tu comportamiento para acomodar la tecnología. En los coches, esto significa un control verdaderamente manos libres que funcione mientras conduces a velocidades de autopista con música sonando y pasajeros hablando. Los hogares inteligentes se vuelven genuinamente inteligentes cuando pueden entender quién está hablando y desde dónde, manejando solicitudes simultáneas sin confusión.

La idea clave es que la audición espacial AI no solo mejora el reconocimiento de voz, sino que también permite nuevos paradigmas de interacción. Cuando los dispositivos pueden comprender la escena acústica completa, pueden participar en el flujo natural de la comunicación humana, en lugar de depender de restricciones artificiales. Los dispositivos portátiles se vuelven mucho más útiles cuando pueden aislar tu voz de las conversaciones que te rodean, y los espacios públicos pueden ofrecer asistencia de voz personalizada pero privada. Como se mencionó para la robótica, esto constituye un cambio fundamental en la forma en que los humanos y las máquinas interactuarán con los robots que se integran en nuestras vidas.

La privacidad es una creciente preocupación con dispositivos que siempre están escuchando. ¿Cómo equilibra Kardome la demanda de procesamiento en el dispositivo con la necesidad de rendimiento y precisión?

La gran mayoría de las soluciones de IA de voz actuales operan en un modelo híbrido, compuesto por un componente en el dispositivo (borde) y un componente basado en la nube. Si bien el procesamiento en el borde no plantea preocupaciones de privacidad, ya que los datos nunca dejan el dispositivo del usuario, el procesamiento en la nube presenta un desafío significativo para la privacidad de los datos.

Kardome aborda este desafío ampliando significativamente las capacidades del componente en el borde. Al procesar más datos localmente y reducir la dependencia de la nube, Kardome garantiza que los datos de voz sensibles nunca dejan el dispositivo, ofreciendo una protección de privacidad superior en comparación con otros sistemas en el mercado.

Una preocupación importante con los dispositivos “siempre escuchando” no es que el micrófono capte audio, sino el riesgo de que ese audio se suba a la nube para su análisis. En la práctica, el costo prohibitivo del procesamiento continuo en la nube significa que la mayoría de los sistemas comerciales evitan esto, pero esto se hace a un costo: una calidad y una respuesta de la interfaz de voz más bajas.

Kardome resuelve este compromiso al llevar potentes modelos de lenguaje siempre activos al dispositivo en sí. Con nuestra tecnología, la escena acústica, el habla natural y el contexto se analizan en tiempo real directamente en el dispositivo. No se sube ni se guarda ningún dato de voz. Este enfoque innovador permite a Kardome ofrecer tanto una privacidad de datos robusta como una interfaz de voz altamente eficiente, eliminando el compromiso que los usuarios enfrentan actualmente.

Al mirar la industria en general, ¿cuáles son los obstáculos más grandes que la IA de voz aún debe superar antes de convertirse en la interfaz dominante en la electrónica de consumo?

El obstáculo más grande es que la IA de voz todavía no se comunica como los humanos. Hasta que la IA de voz pueda escuchar y entender como los humanos, con una conciencia completa del contexto y la capacidad de comprender el flujo conversacional, no se convertirá en la interfaz principal que la gente quiere que sea. Un obstáculo técnico significativo en este punto es que la mayoría de la tecnología de IA de voz es basada en la nube. Esto impide inherentemente la escucha continua y, por lo tanto, bloquea la comprensión del flujo conversacional.

El avance vendrá cuando los sistemas de voz puedan comprender verdaderamente el contexto conversacional y responder con la misma conciencia intuitiva que tienen los humanos. Ese es el momento en que la voz se convertirá en la interfaz dominante en toda la electrónica de consumo.

¿Cómo crees que la relación del consumidor con los asistentes de voz evolucionará una vez que se resuelvan la precisión y la confiabilidad en entornos ruidosos?

Una vez que se resuelvan la precisión y la conversación natural, los asistentes de voz pasarán de ser características novedosas a interfaces esenciales en las que la gente confía a lo largo de su día. Cuando la gente sepa que la IA de voz entenderá correctamente la primera vez, incluso en entornos desafiantes, dejarán de adaptarse a la tecnología y comenzarán a usarla instintivamente con lenguaje natural y conversaciones contextuales.

El futuro de la interacción de voz será predictivo y proactivo. Imagina tu dispositivo entendiendo no solo tus palabras, sino también tu tono, señales de emoción y subtexto conversacional. Los sistemas actuales luchan con el ritmo natural de la conversación y no pueden manejar interrupciones, turnos y comprensión contextual. Los humanos se adaptan cuando se les interrumpe; la IA de voz a menudo se confunde. Para los OEM, el desafío es integrar la IA de voz que pueda ofrecer esta interfaz futura sin la complejidad y los requisitos de hardware de las soluciones actuales.

Finalmente, ¿dónde ves a Kardome y al ecosistema de IA de voz dentro de cinco años, y qué hitos definirán si realmente hemos entrado en la era de la computación de voz en primer lugar?

Dentro de cinco años, la IA de voz será tan ubicua como las pantallas táctiles y los teclados son hoy, y se esperará en prácticamente todos los dispositivos computacionales. Kardome será el sistema operativo que permitirá a los usuarios operar sus dispositivos por voz, permitiendo una interacción natural con cualquier dispositivo en cualquier entorno, desde robots hasta gafas inteligentes y coches.

Los hitos definitorios serán conductuales más que tecnológicos. Sabremos que hemos logrado la computación de voz en primer lugar cuando la gente deje de pensar en comandos de voz y comience a tener conversaciones naturales con su entorno, cuando los entornos multiusuario funcionen de manera fluida, y cuando los niños crezcan esperando hablar con cualquier dispositivo de manera natural. La medida final no será lo sofisticada que se vuelva nuestra tecnología, sino lo natural que los humanos interactúen con el mundo digital.

Gracias por la gran entrevista, los lectores que deseen aprender más pueden visitar Kardome.

Antoine es un líder visionario y socio fundador de Unite.AI, impulsado por una pasión inquebrantable por dar forma y promover el futuro de la IA y la robótica. Como empresario serial, cree que la IA será tan disruptiva para la sociedad como la electricidad, y a menudo se le escucha hablando con entusiasmo sobre el potencial de las tecnologías disruptivas y la AGI.

Como futurista, está dedicado a explorar cómo estas innovaciones darán forma a nuestro mundo. Además, es el fundador de Securities.io, una plataforma enfocada en invertir en tecnologías de vanguardia que están redefiniendo el futuro y remodelando sectores enteros.