Entrevistas
Matt Hocking, Co-Fundador de WellSaid Labs – Serie de Entrevistas

Matt Hocking es el co-fundador de WellSaid Labs, una empresa líder en generadores de voz de IA de nivel empresarial. Tiene más de 15 años de experiencia liderando equipos y entregando soluciones tecnológicas a gran escala.
Su trasfondo es bastante emprendedor, ¿cómo se involucró inicialmente en la IA?
Supongo que siempre me he considerado bastante emprendedor. Empecé mi primer negocio después de la universidad y, con un trasfondo en diseño de productos, me he encontrado gravitando hacia ayudar a la gente con ideas en etapas tempranas. A lo largo de mi carrera, he tenido la suerte de trabajar con un número de startups que han tenido algunos éxitos increíbles. Durante esas experiencias, he tenido exposición a muchos grandes fundadores de primera mano, lo que me ha inspirado a perseguir mis propias ideas como fundador. La IA era relativamente nueva para mí cuando me uní a AI2; sin embargo, esa experiencia me proporcionó la oportunidad de aplicar mi lente de producto y startup a algunas investigaciones verdaderamente increíbles y imaginar cómo estos nuevos avances podrían ayudar a mucha gente en los próximos años. Mi objetivo desde el principio ha sido desarrollar negocios reales para personas reales, y creo que la IA tiene el potencial de crear muchas oportunidades y eficiencias emocionantes en nuestro futuro si se aplica de manera reflexiva.
¿Podría compartir la historia de cómo se concibió la idea de WellSaid Labs cuando era emprendedor en residencia en The Allen Institute for AI?
Me uní a The Allen Institute for Artificial Intelligence (AI2) como Emprendedor en Residencia en 2018. Arguablemente el incubador más innovador del mundo, AI2 alberga las mentes más brillantes en IA que aplican soluciones desde el límite de lo que es posible hoy en día a productos tangibles que resuelven problemas en todo el mundo. Mi trasfondo en diseño y tecnología nutrió un interés de larga data en los campos creativos, y con el auge de la IA que estamos presenciando hoy, quería explorar una forma de conectar los dos. Me presentaron a Michael Petrochuk (co-fundador y CTO de WellSaid Labs) mientras desarrollaba una aplicación de salud interactiva que guiaba a los pacientes a través de varios escenarios sensibles. Durante el proceso de desarrollar el contenido para la experiencia, mi equipo trabajó con talentos de voz para grabar miles de líneas de voz en off para el avatar. Cuando me expusieron a algunos de los avances que Michael había logrado durante su investigación, ambos vimos rápidamente el valor de cómo la voz de paridad humana con IA (TTS) podría transformar no solo el producto en el que estaba trabajando, sino también impactar una serie de otras aplicaciones y industrias. La tecnología y la herramienta habían luchado por mantenerse al día con las necesidades de los productores que creaban con la voz como medio. Vimos un camino para poner esta tecnología en manos de todos los creadores, permitiendo que la voz fuera una parte integral de todas las historias.
WellSaid Labs es una de las pocas empresas que brinda a los actores de voz una oportunidad para ingresar al espacio de la voz de IA. ¿Por qué creyó que era importante integrar voces reales en el producto?
Nuestra respuesta a esto es de dos partes: primero, queríamos crear soluciones que complementaran las capacidades de los actores de voz profesionales, expandiendo las oportunidades para la voz. Y segundo, nos esforzamos por tener el nivel más alto de calidad humana en nuestros productos. Nuestros actores de voz son socios colaborativos a largo plazo y reciben compensación y participación en los ingresos por tanto su voz y el contenido producido con ella. Cada actor de voz que contratamos para crear un avatar de voz de IA basado en su voz es pagado según cuánto se utilice su voz en nuestra plataforma. Animamos al talento a asociarse con nosotros; la compensación justa por sus contribuciones es increíblemente importante para nosotros.
Para ofrecer los productos de mayor calidad humana en el mercado, debemos ser rigurosos sobre dónde obtenemos nuestros datos. Este proceso nos da más control sobre la calidad, ya que entrenamos a nuestros modelos de aprendizaje profundo para hablar tanto a la paridad humana como a estilos relevantes contextualmente. No solo creamos una voz que recita la entrada proporcionada. Nuestros modelos ofrecen una variedad de estilos de voz que realizan lo que está en la página. Ya sea que los usuarios estén creando voz en off utilizando un avatar de nuestra biblioteca o creando voz en off con una voz personalizada para su marca, utilizamos datos de voz reales para garantizar un proceso sin problemas y una plataforma fácil de usar. Si nuestros clientes tuvieran que manipular y editar nuestras voces en post-producción, el proceso de obtener la salida deseada sería torpe y largo. Nuestras voces toman el contexto del contenido escrito y brindan una lectura contextualmente precisa. Ofrecemos voces para todos los tipos de casos de uso, ya sea leyendo las noticias, creando un anuncio de audio o soporte de centro de llamadas automatizado, así que asociarse con talentos de voz profesionales para cada caso de uso nos proporciona tanto el contexto como los datos de voz de alta calidad.
Actualizamos y agregamos regularmente nuevos estilos y acentos a nuestra biblioteca de avatares para garantizar que representemos las voces de nuestros clientes. En el estudio de WellSaid Labs, los clientes y las marcas pueden audicionar diferentes voces según la región, el estilo y el caso de uso, lo que permite una producción de contenido de audio más fluida y unificada personalizada para las necesidades del creador. Una vez que se muestrea una grabación inicial, los usuarios pueden activar palabras, deletreos y pronunciaciones específicas para garantizar que la IA hable consistentemente según sus necesidades.
WellSaid Labs está apostando por ser la primera plataforma de voz de IA ética. ¿Por qué la ética de la IA es importante para usted?
A medida que aumenta la adopción de la IA y se vuelve más mainstream, los temores sobre casos de uso perjudiciales y actores maliciosos están en el centro de cada conversación, y estas preocupaciones desafortunadamente están validadas por ocurrencias en el mundo real. La voz de IA no es una excepción; casi todos los días, un nuevo informe de un celebridad, figura pública o político que es deepfaked para anuncios o propósitos políticos hace titulares. Aunque la regulación federal formal sobre esta tecnología todavía está evolucionando, detectar y combatir a actores y usos maliciosos de la voz sintética se volverá cada vez más difícil a medida que la tecnología continúa avanzando.
Proveniente de AI2, donde la ética de la IA es un principio fundamental, Michael y yo tuvimos estas conversaciones desde el primer día. Desarrollar tecnología de habla de IA conlleva responsabilidades significativas en cuanto al consentimiento, la privacidad y la seguridad en general. Sabemos que, como desarrolladores, debemos construir nuestra tecnología de manera segura, abordar las preocupaciones éticas y sentar las bases para el desarrollo futuro de voces sintéticas. Reconocemos el potencial de la tecnología de habla de IA para el mal uso y asumimos nuestra responsabilidad para reducir el potencial de mal uso de nuestro producto. Necesitamos sentar esta base desde el primer día en lugar de correr rápido y cometer errores en el camino. Eso no sería hacer lo correcto por nuestros clientes empresariales y actores de voz, que confían en nosotros para construir un producto de alta calidad y confiable.
Apoyamos plenamente la llamada a la legislación en este campo; sin embargo, no esperaremos a que se promulguen regulaciones federales. Siempre hemos priorizado y seguiremos priorizando prácticas que apoyen la privacidad, la seguridad, la transparencia y la rendición de cuentas.
Nos ceñimos estrictamente a nuestro código de ética de intención, que se basa en construir con innovación responsable en cada decisión que tomamos. Esto es en el mejor interés de nuestros clientes globales, las marcas empresariales.
¿Cómo se desarrolla una plataforma de voz de IA ética?
WellSaid Labs se ha comprometido con la innovación ética desde el principio. Centralizamos la confianza y la transparencia a través del uso de modelos de datos internos, requisitos de consentimiento explícito, nuestro programa de moderación de contenido y nuestro compromiso con la protección de la marca. En WellSaid, nos apoyamos en los principios de IA Responsable para dar forma a nuestras decisiones y diseños, y esos principios se extienden al uso de nuestras voces. Nuestro código de ética representa estos principios como Responsabilidad, Transparencia, Privacidad y Seguridad, y Justicia.
Responsabilidad: Mantenemos estrictos estándares para contenido apropiado, prohibiendo el uso de nuestras voces para contenido que sea perjudicial, odioso, fraudulento o destinado a incitar violencia. Nuestro equipo de Confianza y Seguridad mantiene estos estándares con un programa riguroso de moderación de contenido, bloqueando y eliminando a los usuarios que intentan violar nuestros Términos de Servicio.
Transparencia: Requerimos consentimiento explícito antes de construir una voz sintética con los datos de voz de alguien. Los usuarios no pueden subir datos de voz de políticos, celebridades o cualquier otra persona para crear un clon de su voz a menos que tengamos el consentimiento explícito y escrito de esa persona.
Privacidad y Seguridad: Protegemos las identidades de nuestros actores de voz utilizando imágenes de stock y seudónimos para representar las voces sintéticas. También los animamos a ejercer precaución sobre cómo y con quién comparten su asociación con WellSaid Labs o otras empresas de voz sintética para reducir la oportunidad de mal uso de su voz.
Justicia: Compensamos a todos los actores de voz que proporcionan datos de voz para nuestra plataforma y les brindamos una participación continua en los ingresos por el uso de la voz sintética que construimos con sus datos.
Además de estos principios, también respetamos estrictamente la propiedad intelectual. No reclamamos la propiedad del contenido proporcionado por nuestros usuarios o actores de voz. Priorizamos la integridad, la justicia y la transparencia en todo lo que hacemos, asegurando que nuestra tecnología de habla sintética se utilice de manera responsable y ética. Buscamos activamente asociaciones con voces de diversos orígenes y experiencias para garantizar que WellSaid Labs brinde una voz para todos.
Nuestro compromiso con la innovación responsable y el desarrollo de la tecnología de voz de IA con la ética en mente nos distingue de otros en el espacio que buscan capitalizar una nueva industria no regulada por cualquier medio. Nuestras primeras inversiones en ética, seguridad y privacidad establecen la confianza y la lealtad dentro de nuestros actores de voz y clientes, que cada vez más buscan productos y servicios éticamente elaborados por las empresas a la vanguardia de la innovación.
WellSaid Labs ha creado su propio modelo de IA interno que permitió que sus voces de IA alcanzaran la paridad humana, y lo ha logrado al traer las imperfecciones que los humanos tienen en las conversaciones. ¿Qué hay sobre estas imperfecciones que hacen que la IA sea mejor, y cómo se implementan estas imperfecciones?
WellSaid Labs no es solo otro generador de TTS. Donde la tecnología de TTS temprana no podía reconocer las cualidades de la voz humana como el tono, la entonación y el dialecto que transmiten el contexto y la emoción detrás de las palabras, las voces de WellSaid han alcanzado la paridad humana, trayendo imperfecciones humanas únicas a la voz generada por IA.
Nuestra medida principal de la calidad de la voz es y siempre ha sido la naturalidad humana. Esta creencia orientadora ha dado forma a nuestra tecnología en cada etapa, desde las bibliotecas de guiones que hemos construido hasta las instrucciones que damos al talento y, más recientemente, cómo iteramos sobre nuestros algoritmos de TTS básicos.
Entrenamos en vocalizaciones humanas auténticas. Nuestro talento de voz lee sus guiones de manera auténtica y atractiva cuando graban para nosotros. La perfección del habla, por otro lado, es un concepto mecánico que conduce a una salida robotizada y antinatural. Cuando los talentos de voz profesionales actúan, su velocidad de habla fluctúa. Su sonoridad se mueve en conjunción con el contenido que están leyendo. Su voz puede subir en un pasaje que requiere una lectura emocionada y caer nuevamente en una línea más sombría. Estas variaciones dinámicas componen un desempeño vocal humano atractivo.
Al construir procesos de IA que trabajen en coordinación con los desempeños dinámicos de nuestro talento profesional, hemos construido una plataforma de TTS verdaderamente natural. Desarrollamos el primer sistema de TTS de largo formulario con controles predictivos en todo el proceso creativo. Nuestra biblioteca fonética contiene una colección diversa de datos de audio, lo que permite a los usuarios incorporar señales de voz específicas, como orientación de pronunciación o controlabilidad, en el modelo durante la fase de producción. En una plataforma, los usuarios de WellSaid pueden grabar, editar y personalizar su voz en off sin necesidad de importar datos externos.
¿Podría discutir algunos de los desafíos detrás de la construcción de una empresa de TTS de IA?
El desarrollo de la tecnología de voz de IA ha creado un conjunto completamente nuevo de obstáculos para ambos productores y consumidores. Uno de los principales desafíos es no dejarse llevar por el ruido y la publicidad que inunda el sector de la IA. Como una tecnología nueva y emocionante, muchas organizaciones están tratando de aprovechar los desarrollos de voz de IA a corto plazo. Queremos brindar una voz para todos, guiados por principios éticos centrales y autenticidad. Esta adhesión a la autenticidad puede retrasar el desarrollo y la implementación de nuestras tecnologías, pero solidifica la seguridad y la seguridad de las voces de WellSaid y sus datos.
Otro desafío al desarrollar nuestra plataforma de TTS fue desarrollar pautas de consentimiento específicas para garantizar que las organizaciones o actores individuales no malogren nuestra tecnología. Para combatir este desafío, buscamos asociaciones colaborativas y a largo plazo y estamos completamente involucrados con el desarrollo de voz en off para aumentar la responsabilidad, la transparencia y la seguridad del usuario. Buscamos activamente asociaciones con talentos de voz de diversos orígenes, organizaciones y experiencias para garantizar que la biblioteca de voces de WellSaid Labs refleje a sus creadores y audiencias. Estos procesos están diseñados para ser intencionales y detallados para garantizar que nuestra tecnología se utilice de la manera más segura y ética posible, lo que puede ralentizar el desarrollo y el lanzamiento.
¿Cuál es su visión para el futuro de las voces de IA generativas?
Durante mucho tiempo, la tecnología de habla de IA no ha alcanzado una calidad lo suficientemente alta como para permitir que las empresas creen contenido significativo a gran escala. Ahora que la tecnología de audio ya no requiere equipo y hardware costosos, todo el contenido escrito se puede producir y publicar en un formato de audio para crear experiencias multicanal atractivas y naturales.
Hoy en día, las voces de IA pueden producir audio similar al humano y capturar la sutileza necesaria para hacer que la narración digital sea más accesible y natural. El futuro de la voz de IA generativa será una experiencia audible integral que tocará todos los aspectos de nuestras vidas. A medida que la tecnología continúa avanzando, veremos voces sintéticas cada vez más naturales y expresivas que borran la línea entre el habla humana y la generada por máquina, abriendo nuevas puertas para los negocios, las comunicaciones, la accesibilidad y la forma en que interactuamos con el mundo que nos rodea.
Las empresas encontrarán una mayor personalización en las interfaces de voz de IA y las utilizarán para hacer que las interacciones con asistentes virtuales sean más inmersivas y fáciles de usar. Estos mejoramientos ya están sucediendo, desde agentes de centro de llamadas inteligentes hasta cajeros de comida rápida. La creación de contenido, incluyendo publicidad, marketing de productos, narración de noticias, podcasts, audiolibros y otros multimedia, verá una mayor eficiencia al utilizar herramientas para desarrollar contenido atractivo, lo que en última instancia aumentará el levantamiento y los ingresos para las organizaciones, especialmente ahora que los modelos multilingües pueden expandir el alcance de una empresa desde un solo punto de origen a tener una presencia global. Los equipos de producción encontrarán un gran beneficio en las voces sintéticas para crear voces personalizadas para las necesidades de la marca o personalizadas para el oyente.
Antes de la introducción de la IA, la tecnología de TTS carecía de la emoción humana, la entonación y las capacidades de pronunciación necesarias para contar una historia completa a gran escala y con facilidad. Ahora, la TTS impulsada por IA ofrece experiencias más inmersivas y accesibles, incluyendo capacidades de habla en tiempo real y agentes conversacionales interactivos.
Achieving human-like speech capabilities has been a journey, but now that it’s attainable, we’re witnessing the complete scope of AI voice to create real business value for organizations.
Thank you for the great interview, readers who wish to learn more should visit WellSaid Labs.












