Entrevistas

Phil Marshall, Fundador y CEO de Spoken – Serie de entrevistas

mm
Añade Unite.AI a tus fuentes preferidas en Google

Phil Marshall, fundador y CEO de Spoken, es médico, inventor, emprendedor tecnológico y escritor de ciencia ficción cuya carrera ha abarcado la salud, los medios digitales, la inteligencia artificial y la innovación de productos. Antes de lanzar Spoken en 2024, Marshall cofundó Conversa Health, una empresa de compromiso personalizado con pacientes y de IA conversacional que fue adquirida por Amwell en 2021 y se integró a su negocio de atención virtual automatizada. Al comienzo de su carrera, pasó más de una década en WebMD como vicepresidente de Estrategia de Producto, luego se desempeñó como vicepresidente senior de Gestión de Producto en Press Ganey Associates y fundó la startup de tecnología de video colaborativo JumperCut. Su trabajo se centra cada vez más en la intersección de la IA, la narración, las interfaces cerebro‑computadora y las tecnologías del conocimiento, combinando su experiencia como tecnólogo y emprendedor con sus intereses en la ciencia ficción y las formas emergentes de interacción digital.

Spoken es una plataforma de audiolibros impulsada por IA diseñada para ayudar a autores, editoriales y titulares de derechos a transformar manuscritos en audio producido profesionalmente sin depender de un estudio de grabación tradicional. Su tecnología analiza el lenguaje, estilo, estructura narrativa y personajes del manuscrito antes de asignar voces distintas para la narración y el diálogo, admitiendo producciones con un solo narrador, dos narradores o multi‑cast. Los autores pueden usar voces generadas a medida, seleccionar entre más de 100 actores de voz profesionales de pago, o clonar su propia voz, manteniendo la propiedad de su obra, los masters y los derechos de distribución. Spoken también ofrece una interfaz de programación de aplicaciones (API) dirigida a editoriales que buscan producir audiolibros en catálogos más extensos, al tiempo que enfatiza un modelo ético de IA bajo el cual afirma que los textos escritos no se utilizan para entrenar sus sistemas y los actores de voz humanos participantes son remunerados.

Tu carrera te ha llevado desde la medicina y la estrategia de producto en WebMD hasta fundar Conversa Health y ahora Spoken. ¿Qué problema en la creación de audiolibros te convenció de fundar Spoken, y cómo influyó tu trabajo previo en IA conversacional en la plataforma que estás construyendo hoy?

Con Conversa, nuestra misión era ampliar la voz del equipo de atención automatizando contactos personalizados, preguntas de seguimiento y orientaciones que un departamento clínico de un gran sistema de salud proporcionaría directamente a los pacientes por teléfono, si tuviera tiempo. Inicialmente, antropomorfizamos el bot con una personalidad, Cate, que se refería a sí misma en primera persona. Finalmente, sin embargo, decidí que fingir humanidad era engañoso. Cate no era una persona, y no quería que los pacientes lo pensaran. Por eso, eliminamos el nombre de la personalidad y cambiamos a un plural “Nosotros” para que se percibiera como una extensión del equipo de atención, que era lo que era. La experiencia me enseñó que las soluciones automatizadas pueden seguir siendo una extensión auténtica del cuidado humano sin pretender ser humanas.

Avanzando a Spoken, donde nos centramos en una expresión auténtica y centrada en el ser humano. El problema que ayudamos a resolver es evidente: la mayoría de las historias no pueden llegar a la audiencia de mayor crecimiento (oyentes) con todo su potencial de audio debido a limitaciones de tiempo y costo, pero mi filosofía de largo plazo de ser una extensión genuina de los humanos jugó un papel importante. A diferencia de los podcasts de IA que intentan fabricar conversaciones o agentes que simulan compasión, la narración Multi‑Cast de Spoken da vida a las verdaderas palabras del autor. Como contamos historias, no intentamos replicar interacciones humanas, por lo que no hay pretensión de que nuestra IA sea una persona. Son personajes de una historia, así que tenemos la suerte de evitar cualquier confusión o conflicto.

Como escritor de ciencia ficción dura y emprendedor de IA, ¿cómo esperabas que evolucionara la inteligencia artificial y en qué aspecto la realidad del desarrollo de la IA se ha desviado más marcadamente del futuro que imaginabas?

Esta pregunta es muy cercana a mi corazón. Me encanta vivir en la intersección del arte, la ciencia y la tecnología, y representar sistemas automatizados en mi ciencia ficción del futuro cercano es un gran ejemplo de ello. De hecho, cada empresa futura de la que escribo —y son varias— tiene un dominio que he poseído, un producto que he diseñado y un concepto que creo que algún día podría convertirse en una empresa real. Incluso la escultura frente a mi casa está modelada según la forma modernista del logotipo de The Kite Factory, una compañía que imagino que algún día creará la tecnología antigravedad que transformará el planeta.

Al centrarme en la IA, tengo un problema cuando la ciencia ficción del futuro no aborda cómo las personas obtienen, usan y comparten información. ¿En el año 2100 seguirán usando un teléfono para llamar a la gente y responder preguntas de hecho? Mi filosofía al escribir, y en la vida real, es simple: lo que pueda automatizarse se automatizará, y siempre tenderemos a una información más en tiempo real, más colaborativa y más integrada físicamente. Debo añadir, sin embargo, que tengo una aversión personal a los implantes. Por eso, en la historia de fondo de mi libro, cuando Elon Musk conectó sus satélites Starlink a sus implantes Neuralink y comenzó a transmitir mensajes directamente al cerebro de las personas, ¡prohibimos los implantes cerebrales!

En cuanto a la divergencia: porque creo que lo que pueda automatizarse se automatizará, la automatización de preguntas de hecho está ocurriendo como una simple inevitabilidad. Sin embargo, cuando se trata de asuntos del corazón —arte, música e historias— ha habido cierta divergencia. Dado que la IA se entrena con patrones preexistentes, por definición, nunca podrá crear algo verdaderamente nuevo. Sin embargo, la gente escribe historias, crea arte y compone música usando IA. ¿Cómo es posible? Porque el arte no tiene que ser verdaderamente nuevo o único. Eso, creo, significará que en el futuro, esas creaciones que rompan el molde serán aún más valiosas. Espero que aún podamos reconocer cuándo ocurre eso.

Un reciente estudio de Edison Research comparó la producción multi‑cast de Spoken con una versión humana de un solo narrador producida profesionalmente. ¿Cuánto del ventaja de Spoken atribuyes a la tecnología subyacente de IA y cuánto proviene de dar a cada personaje una voz distinta? ¿Cómo podrían diferir los resultados frente a un elenco humano completo?

Analizar la historia y cada personaje para derivar su voz perfecta es, de hecho, una gran parte de nuestra IA. Pasamos por un proceso intensivo y agente para extraer las capas subyacentes de la historia, desde rudimentos como el género y el idioma hasta la cadencia dictada por acentos y estilo, así como la cohesión de escena de múltiples personajes interactuando. Todas estas capas impulsadas por IA informan la narración de la voz del personaje. Es lo que llamamos “Modo Mágico”, y puedes imaginarlo como mezclar colores de pintura.

En cuanto a cómo podrían diferir los resultados de un elenco humano completo, realmente se reduce a costos y flujo de trabajo. Un solo clic y cientos de dólares, en comparación con un elenco completo, no es accesible para autores independientes y la mayoría de las editoriales, por lo que no fue nuestro punto de comparación. En cuanto a la calidad, sin embargo, creo que ya estamos acercándonos a la paridad con un elenco completo, por lo que la calidad será indistinguible.

Spoken Multi‑Cast recibió calificaciones más altas para escenas impulsadas por personajes, mientras que la narración humana tuvo mejor desempeño durante la exposición. ¿Qué hace que los pasajes sin diálogo sean particularmente difíciles para la narración de IA y cómo están trabajando para cerrar esa brecha?

En realidad, no es que los pasajes sin diálogo sean difíciles para la narración de IA; simplemente el número de dinámicas con las que la IA debe trabajar sigue siendo menor que el que tiene un actor de voz humano. Piensa en cada matiz de inflexión y entrega que un solo narrador puede aportar a un pasaje. Con el multi‑cast, sin embargo, el número de dinámicas es mucho mayor debido a los timbres variados y personalizados de las voces de los personajes y ese proceso de mezclarlas, de nuevo, como colores de pintura. Eso significa que las escenas multi‑cast pueden aportar realismo a las interacciones entre varias personas de una forma que un solo narrador tendría dificultades para igualar.

En cuanto a cerrar la brecha, el número de dinámicas usadas en la narración de IA con un solo narrador seguirá aumentando, y la brecha continuará reduciéndose.

Antes de escuchar las muestras, solo el 31 % de los participantes mostraba interés en audiolibros narrados por IA, pero esa cifra aumentó al 65 % después de que experimentaran Spoken Multi‑Cast. ¿Qué elementos de la actuación crees que fueron los más responsables de cambiar sus percepciones?

En realidad, fue al revés, y ese elemento de diseño de la encuesta es muy importante. El 65 % dijo que escucharía un audiolibro completo con esta narración después de escuchar los extractos, antes de saber que era IA. Luego preguntamos, de forma más general, si estarían dispuestos a escuchar audiolibros narrados con IA, y solo el 31 % respondió que sí. Después, preguntamos si creían que lo que habían escuchado era IA. Solo el 39 % de los que escucharon Spoken Multi‑Cast sospechó que podría ser IA, comparado con el 35 % de los que escucharon las versiones humanas y pensaron que podrían ser IA. Esto hizo que nuestra siguiente pregunta surgiera: Ahora que lo sabes, ¿estarías dispuesto a escuchar un audiolibro narrado con IA? Esa disposición subió al 43 % después de la exposición, y estamos optimizando activamente para cerrar la brecha hacia nuestro punto de referencia del 65 %.

¿Puedes guiarnos a través del flujo de trabajo de IA agente que transforma un manuscrito subido en un audiolibro de múltiples voces, incluyendo cómo el sistema identifica a los hablantes, interpreta a los personajes, asigna voces y determina emoción, tiempo y entrega?

Dado que tenemos patentes pendientes sobre el proceso, lo resumiré a grandes rasgos diciendo que es un proceso intensamente agente que entrega múltiples capas. Es un proceso que hemos perfeccionado durante más de dos años. Los rudimentos de la historia, la cadencia de la historia, la cohesión de la escena y, finalmente, las voces precisas de los personajes, o como me gusta llamarlas, “la capa de pintura”, forman parte de ello. Obtener el arco de la entrega emocional y el timing es crítico, y trabajamos en eso más que en cualquier otra cosa. A menudo sorprende a la gente que la IA utilizada para preparar la narración sea aproximadamente 5 veces la cantidad de IA usada en la narración real.

¿Cuánta control creativo conserva un autor sobre la producción final y qué herramientas están disponibles cuando la IA interpreta mal a un personaje, la pronunciación, el ritmo emocional o la intención narrativa?

El autor tiene control absoluto sobre la producción final. Ya sea las inflexiones emocionales, los acentos, el timbre de la voz o el timing, lo controlan todo. Nuestro objetivo es acercarlos a la perfección con un solo clic tanto como sea posible. Si el autor, editorial o productor necesita una entrega muy específica de un pasaje, pueden usar “Speak It” para hablar en su micrófono y demostrar cómo lo quieren, y la voz del personaje obedecerá hermosamente.

Creemos que los autores deben sentir plena propiedad de su obra, hasta la voz utilizada en sus créditos de apertura y cierre. Incluso “Made with Spoken” usará la voz que elijan, incluida su propia voz personal si así lo desean.

Spoken permite a los autores usar voces generadas a medida, así como clones de voz aprobados de narradores profesionales que son compensados cuando se usan sus voces. ¿Cómo se integran el consentimiento, la propiedad, la compensación, los derechos de revocación y la protección contra la clonación no autorizada en ese modelo?

Solo utilizamos socios de voz que se adhieran a un estricto código de ética, que incluye la detección y prohibición del uso no autorizado de una voz (especialmente importante para proteger voces notables de celebridades). Por ejemplo, contamos con muchas de las voces principales de ElevenLabs en nuestra biblioteca. Esos actores de voz reciben pago por cada uso por parte de nuestros autores.

¿Ves la narración de IA ampliando principalmente el mercado de audiolibros al hacer viables títulos previamente no rentables, o también reemplazará partes de la producción tradicional? ¿Qué roles permanecerán claramente humanos a medida que la tecnología madure?

Prevemos un mercado de audiolibros enormemente ampliado que atraerá a nuevos lectores, especialmente gracias a nuestras nuevas y vívidas capacidades multi‑cast. Al final, ese mercado ampliado será impulsado por una combinación de tecnología y humanos. El tiempo lo dirá, pero esta transformación puede ser menos sobre si se trata de talento vocal humano o IA, y más sobre el flujo de trabajo de control del autor/productor y los hábitos de escucha siempre cambiantes de la audiencia.

Spoken combina la producción de audiolibros con la publicación, el descubrimiento, la transmisión, la comunidad y la monetización. ¿Cómo podría la IA cambiar finalmente la propia narración, en lugar de simplemente hacer que el proceso de producción de audiolibros existente sea más rápido y menos costoso?

¿Qué significa para un lector o oyente “perderse en la historia”? De eso se trata realmente: ofrecer al público una experiencia de audio inmersiva en un momento en que la demanda de ficción impulsada por personajes está creciendo y el audio se está convirtiendo en la modalidad dominante para consumir historias. Al final, ya sea un cuento corto, una memoria personal, fanfic o fantasía épica, la rapidez y el bajo costo de crear una entrega vívida y natural tendrán profundas implicaciones a largo plazo. El mercado actual de audiolibros es la oportunidad a corto plazo, pero los formatos de corta duración, shorts verticales, series, fanfic y cualquier número de ramificaciones prosperarán como resultado. Y cuando lo hagan, queremos que Spoken Multi‑CastTM esté en su corazón.

Gracias por la gran entrevista, los lectores que deseen saber más deberían visitar Spoken

Antoine es un líder visionario y socio fundador de Unite.AI, impulsado por una pasión inquebrantable por dar forma y promover el futuro de la IA y la robótica. Como empresario serial, cree que la IA será tan disruptiva para la sociedad como la electricidad, y a menudo se le escucha hablando con entusiasmo sobre el potencial de las tecnologías disruptivas y la AGI.

Como futurista, está dedicado a explorar cómo estas innovaciones darán forma a nuestro mundo. Además, es el fundador de Securities.io, una plataforma enfocada en invertir en tecnologías de vanguardia que están redefiniendo el futuro y remodelando sectores enteros.