Rozhovory

Jaime Bosch, CEO, Voicemod – Rozhovorová série

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Jaime Bosch je CEO společnosti Voicemod, která nabízí zdarma měňící software pro hráče, tvůrce obsahu a vtubery.

Můžete sdílet příběh o vzniku Voicemodu?

Vyrůstal jsem jako osmý z deseti dětí v prostředí, kde jsem mohl plně rozvinout svůj podnikatelský duch už od velmi mladého věku, protože vždy existovala podpora od stejně smýšlejících sourozenců.

Jako takový to bylo jen otázkou času, kdy dva moji bratři a já, všichni sdílející hlubokou lásku k technologie a hudbě, začali experimentovat s myšlenkou vytvoření aplikace, která by kombinovala naše zájmy. Takže v roce 2009 jsme to udělali a vytvořili B2C hudební aplikaci jako vedlejší projekt k našemu studiovému podnikání, který jsme provozovali jako naše hlavní zaměstnání.

Jako vedlejší projekt, experimentovali jsme s mnoha věcmi, jako je modulace hlasu, což nás inspirovalo k vytvoření něčeho zcela nového a originálního. Výsledkem toho byla takzvaná “Voicemod Experience” – zcela nový způsob, jak prožít svůj vlastní hlas – který se stal hnací silou evoluce aplikace. Bez ohledu na to, kdo náš software vyzkoušel, setkávali jsme se se stejnými reakcemi od lidí, kteří aplikaci zažili: smích a údiv nad tím, že slyší sami sebe úplně jinak.

To nás vedlo k přehodnocení naší vize pro produkt, do něčeho, co by mohlo nakonec evolucí lidské spojení prostřednictvím média zvuku. Takže jsme zkušenost z mobilních zařízení přenesli na PC, kde byla okamžitě přijata explozivní herní a streamovací scénou – a zbytek je, jak se říká, „historie“.

Voicemod byl původně vedlejším projektem — kdy jste si uvědomili, že chcete jít naplno?

Původně, moji bratři a já měli studio spolu nazvané 2taptap. Když jsme přišli s nápadem vytvořit Voicemod, byl to původně jen zábavný vedlejší projekt, ale jak čas plynul, viděli jsme, jak lidé interagují s ním a jaký potenciál měla technologie. Do té doby byla většina technologie změny hlasu asynchronní, takže být schopni prožít být někým jiným v reálném čase bylo něco nového pro mnoho lidí. Definujícím momentem pro nás však bylo uvědomění, že lidé používají naši technologii, aby nejenom měli zábavu, ale aby formovali celý svůj způsob, jakým se vyjadřují online. To bylo okamžik, kdy jsme si uvědomili, že budujeme něco, co není jen o zábavě, ale možná o dalším kroku v budoucnosti sociálních audio zkušeností.

Můžete diskutovat některé z technologií rozpoznávání hlasu?

S naší škálou měničů hlasu v našem katalogu, existují procesy, které jsou podstupovány, aby se běžný lidský hlas transformoval do něčeho nového. Samozřejmě, existují také aspekty v hlasu, které je třeba zohlednit, jako je věk, pohlaví, emoce a jednoduché variace, jak někdo mluví.

Tyto variace přispívají k tomu, jak někdo může znít a ovlivňují změny, které jsou aplikovány. Utilizujeme prvky ze špičkové technologie rozpoznávání hlasu, aby se usnadnilo převod a transformace hlasu co nejpřesněji — a neustále vylepšujeme tento proces. Chceme dát lidem příležitost strukturovat, jak jsou vnímáni, znít tak, jak chtějí být slyšeni, a poskytnout skvělou poslechovou zkušenost jejich publiku.

Proč je důležité pomáhat lidem vyjadřovat se prostřednictvím zvuku?

Od okamžiku, kdy se narodíme a první výkřik dítěte, je zvuk přirozeným způsobem, jakým se učíme vyjadřovat sami sebe. Jak stárneme, důležitost audio komunikace pokračuje v růstu, protože se učíme formovat zvuk do jazyka a používat naše hlasy, aby se přidala emoce a nuance do slov, která mluvíme. Zvyšováním tónu našeho hlasu, můžeme signalizovat vzrušení – nebo použít zvukové efekty, jako jsou vzdechy nebo steny, aby se přidala zvláštní důraz na body, které chceme udělat.

Pro některé opravdu talentované lidi, je hlas nástrojem pro neomezené vyjádření – jako mohou vytvářet neomezené množství zvukových efektů nebo hlasů. Většina z nás, však, není tak šťastná a vlastně cítí nepohodlí se svými hlasy (zejména když slyšíme nahrávky). Někteří naši uživatelé mluví o tom, že se cítí nervózně, když mluví před cizími lidmi a jsou frustrovaní z toho, že nemohou se správně vyjadřovat způsobem, jakým by chtěli.

To je místo, kde vidíme obrovskou příležitost, abychom pomohli lidem. S našimi hlasovými identitami, uživatelé mohou formovat své hlasy, aby byli něčím, s čím se cítí pohodlně – nebo dokonce sklouznout do různých hlasů pro specifické situace. Chceme také posílit je, aby používali zvukové efekty, hudební klipy nebo audio emotikony, aby vytvořili atmosféru, vyjádřili kontext nebo implementovali komediální efekty – podobně jako grafické emotikony pomáhají formovat textovou komunikaci.

Vy jste popsali Voicemod jako evoluci lidského spojení prostřednictvím zvuku, můžete to vysvětlit?

Kromě osvobození mluvčího a odstranění jistého mentálního bloku, který zastavuje lidi od mluvení, také pracujeme na hlubší spojení. Například naše soundboard komunikaci a elevuje ji na další úroveň — přemýšlejte o tom jako o “audio emotikonu”. Můžete si představit lidi pod 35 lety, kteří komunikují bez použití emotikon? Přitom tato technologie existuje už dlouho, ale skutečně se hluboce zakořenila v naší komunikaci až kolem roku 2010. Viděli jsme podobný trend s nalepkami na messagingových platformách, vzestupem hlasových zpráv a hlasových poznámek a nyní se objevuje použití GIFů a Giphy. S měřítkem celosvětové audio komunikace, důležitost toho, jak používáme zvuk, roste. Poslání audio reakce na vtip přítele může říci mnohem více o vaší surové, upřímné reakci než jen napsání věty. Přemýšlejte o rozdílu mezi slyšením cvrčků a ba dum tss! Všichni drží různé významy a sentimenty, které můžete snadno komunikovat pomocí jednoho kliknutí.

Chceme udělat to co nejsnazší pro uživatele, aby využívali hlasy, hlasové efekty a audio emotikony, aby měli více angažovaných audio konverzací s přáteli, rodinou nebo cizími lidmi.

Jaké jsou některé z technologií strojového učení za aplikací Voicemod, včetně umožnění uživatelům znít lépe a přizpůsobit jejich hlas podle jejich skutečného hlasu?

Strojové učení je v srdci většiny nových funkcí Voicemodu.

V souvislosti s kreativní stránkou, Voicemod’s Voicelab vytvořil první technologii reálného času pro převod hlasu na trhu, která umožní uživatelům zvolit si svou vlastní sonickou identitu, vytvářet osobní hlasy pro každého.

S naší novou, pokročilou technologií, která bude brzy vydána, vytváříme nikdy neviděné hlasy s jedinečnými charakteristikami, které pomohou chránit uživatelskou soukromí a bezpečnost, zatímco zároveň umožní uživatelům vytvářet svou požadovanou osobnost prostřednictvím zvuku.

Víme, že lidé tráví většinu svého bdělého času online, připojeni, vyjadřují se na různých platformách a aplikacích. V online prostředích, vaše “avatar” je vaše celková reprezentace. A kdo je ten člověk bez hlasu?

Vyvíjíme technologii reálného času pro změnu hlasu a vytváříme systém plně přizpůsobitelných sonických vyjádření. Naše tým učinil krok z této rovnice, navrhnout celý kit, který lze snadno integrovat vývojáři kdekoli. Jsme extrémně nadšeni, že naše technologii učiníme dostupnou vývojářům a uživatelům po celém světě, protože pokračujeme ve výstavbě budoucnosti sociálních audio zkušeností!

Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit Voicemod.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.