Interviews
Jaime Bosch, CEO, Voicemod – Interview-Serie

Jaime Bosch ist der CEO von Voicemod, einer kostenlosen Software zur Stimmenveränderung für Gamer, Content-Ersteller und Vtuber.
Könnten Sie die Genesis-Geschichte hinter Voicemod teilen?
Als das 8. von 10 Kindern wuchs ich in einer Umgebung auf, in der ich mein unternehmerisches Gespür von sehr jungem Alter an entwickeln konnte, da es immer Unterstützung von gleichgesinnten Geschwistern gab.
So war es nur eine Frage der Zeit, dass zwei meiner Brüder und ich, die alle eine tiefe Liebe zur Technologie und Musik teilten, mit der Idee spielten, eine App zu erstellen, die unsere Interessen verband. Also taten wir 2009 genau das und erstellten eine B2C-Musik-App als Nebenprojekt zum Studio-Geschäft, das wir als unsere Hauptbeschäftigung betrieben.
Da es ein Nebenprojekt war, experimentierten wir viel mit Dingen wie Stimmodulation, was uns inspirierte, etwas völlig Neues und Innovatives zu schaffen. Das Ergebnis davon war, was wir die “Voicemod-Erfahrung” nannten – eine völlig neue Art, die eigene Stimme zu erleben – die zur treibenden Kraft der App-Evolution wurde. Egal, wer unsere Software ausprobierte, wir trafen immer auf die gleiche Art von Reaktionen von den Menschen, die die App erlebten: Lachen und Erstaunen, wenn sie sich selbst auf eine völlig andere Weise hörten.
Dies führte uns dazu, unsere Vision für das Produkt zu überarbeiten, in etwas, das letztendlich die menschliche Verbindung durch den Medium des Sounds entwickeln konnte. Also brachten wir die Erfahrung von Mobile zu PC, wo sie sofort von der explodierenden Gaming- und Streaming-Szene aufgegriffen wurde – und der Rest ist, wie man sagt, “Geschichte”.
Voicemod war ursprünglich ein Nebenprojekt – wann haben Sie realisiert, dass Sie voll einsteigen wollten?
Ursprünglich hatten meine Brüder und ich ein Studio zusammen namens 2taptap. Als wir auf die Idee kamen, Voicemod zu erstellen, war es anfangs nur ein lustiges Nebenprojekt, aber mit der Zeit sahen wir, wie die Menschen damit interagierten und das Potenzial, das die Technologie hatte. Bis zu diesem Punkt war die meisten Stimmenveränderungstechnologie asynchron, also konnten die Menschen nicht in Echtzeit jemand anderes sein. Der entscheidende Moment für uns war die Erkenntnis, dass die Menschen unsere Technologie nicht nur zum Spaß verwendeten, sondern um ihre gesamte Art und Weise, sich online auszudrücken, zu formen. Das war der Moment, als wir realisierten, dass wir etwas aufbauten, das nicht nur über Unterhaltung ging, sondern möglicherweise den nächsten Schritt in der Zukunft der sozialen Audio-Erfahrungen darstellte.
Könnten Sie einige der Spracherkennungstechnologien diskutieren?
Bei der Vielzahl von Stimmenveränderern in unserem Katalog gibt es Prozesse, die durchlaufen werden, um eine normale menschliche Stimme in etwas Neues zu verwandeln. Natürlich gibt es auch Aspekte in einer Stimme, die berücksichtigt werden müssen, wie Alter, Geschlecht, Emotion und einfache Variationen in der Art, wie jemand spricht.
Diese Variationen tragen dazu bei, wie jemand klingt und beeinflussen die Veränderungen, die angewendet werden. Wir nutzen Elemente aus der neuesten Spracherkennungstechnologie, um die Stimmenumwandlung und -veränderung so genau wie möglich zu ermöglichen – und verbessern diese Prozesse kontinuierlich. Wir möchten den Menschen die Möglichkeit geben, zu bestimmen, wie sie wahrgenommen werden, wie sie gehört werden möchten und ihren Zuhörern ein großartiges Hörerlebnis zu bieten.
Warum ist es wichtig, Menschen zu helfen, sich durch Sound auszudrücken?
Ab dem Moment, in dem wir geboren werden und ein Baby zum ersten Mal schreit, ist der Sound die natürliche Weise, durch die wir lernen, uns auszudrücken. Wenn wir älter werden, wächst die Bedeutung der Audio-Kommunikation weiter, da wir lernen, den Sound in Sprache zu formen und unsere Stimmen zu verwenden, um Emotionen und Nuancen in die Worte, die wir sprechen, zu legen. Durch die Erhöhung der Stimmlage können wir Aufregung signalisieren – oder Soundeffekte wie Seufzer oder Stöhnen verwenden, um bestimmte Betonungen auf die Punkte zu legen, die wir machen möchten.
Für einige wirklich talentierte Menschen ist die Stimme ein Instrument für unbegrenzte Ausdrucksformen – sie können eine unbegrenzte Anzahl von Soundeffekten oder Stimmen erstellen. Die meisten von uns sind jedoch nicht so glücklich und fühlen sich tatsächlich unwohl mit ihren Stimmen (besonders wenn sie aufgenommen werden). Einige unserer Benutzer sprechen über ihre Nervosität, wenn sie vor Fremden sprechen, und sind frustriert, dass sie sich nicht auf die Weise ausdrücken können, wie sie es gerne möchten.
Dabei sehen wir eine massive Chance, Menschen zu helfen. Mit unseren Stimmenidentitäten können Benutzer ihre Stimmen so formen, dass sie sich wohl fühlen – oder sogar in verschiedene Stimmen für bestimmte Situationen schlüpfen. Wir möchten sie auch befähigen, Soundeffekte, Musikclips oder Audio-Emojis zu verwenden, um Atmosphäre zu schaffen, Kontext zu vermitteln oder komische Effekte zu erzielen – ähnlich wie grafische Emojis die Textkommunikation geprägt haben.
Sie haben Voicemod als Entwicklung der menschlichen Verbindung durch Sound beschrieben – könnten Sie dies erläutern?
Abgesehen davon, dass wir den Sprecher befreien und einen bestimmten mentalen Block entfernen, der Menschen daran hindert, zu sprechen, arbeiten wir auch daran, diese Verbindung tiefer zu machen. Zum Beispiel erhebt unser Soundboard die Kommunikation auf das nächste Level – denken Sie daran, es als “Audio-Emoji”. Können Sie sich vorstellen, dass Menschen unter 35 Jahren ohne die Verwendung von Emojis chatten? Obwohl diese Technologie bereits seit einigen Jahren existiert, hat sie erst seit etwa 2010 tief in unsere Kommunikation Einzug gehalten. Wir sahen einen ähnlichen Trend bei Sticker auf Messaging-Plattformen, dem Aufkommen von Sprachnachrichten und Sprachnotizen und jetzt der aufkommenden Verwendung von GIFs und Giphy. Mit der Skalierung der weltweiten Audio-Kommunikation wächst die Bedeutung, wie wir den Sound verwenden. Das Senden einer Audio-Reaktion auf einen Witz eines Freundes kann viel mehr über Ihre rohe, ehrliche Reaktion aussagen als nur ein Satz. Stellen Sie sich den Unterschied zwischen dem Hören von Grillen und ba dum tss! vor. Sie alle haben völlig unterschiedliche Bedeutungen und Gefühle, die Sie mit nur einem Klick vermitteln können.
Wir möchten es so einfach wie möglich machen, dass Benutzer Stimmen, Stimmeffekte und Audio-Emojis verwenden, um engagiertere Audio-Gespräche mit Freunden, Familie oder Fremden zu führen.
Was sind einige der maschinellen Lern-Technologien hinter der Voicemod-App, einschließlich der Möglichkeit, dass Benutzer besser klingen und ihre Stimme an ihre reale Stimme anpassen?
Das maschinelle Lernen ist das Herzstück der meisten neuen Voicemod-Funktionen.
Im Hinblick auf die kreative Seite hat Voicemods Voicelab die erste Echtzeit-Stimmenumwandlungstechnologie auf dem Markt entwickelt, die es Benutzern ermöglicht, ihre eigene sonische Identität zu wählen und persönliche Stimmen für jeden zu erstellen.
Mit unserer neuen, fortschrittlichen Technologie, die bald veröffentlicht wird, erstellen wir noch nie gehörte Stimmen mit einzigartigen Merkmalen, die dazu beitragen, die Privatsphäre und Sicherheit der Benutzer zu schützen, während sie gleichzeitig ihre gewünschte Persönlichkeit durch Sound erstellen können.
Wir haben auch datengetriebene Deep-Learning-Methoden beobachtet, die in den letzten Jahren aufgetaucht sind. Diese ermöglichen es uns, abstrakte versteckte Strukturen innerhalb von Sprachsignalen zu erlernen, die sich auf die wahrgenommenen Merkmale der Stimme wie Phonologie, Inhalt, Identität, Absicht und Stimmung beziehen. Durch die Nutzung dieser Technologien können wir die wahrgenommenen Aspekte des Signals kontrollieren und verändern. Dies ermöglicht es uns, Technologien zu entwerfen, die den Benutzern mehr Kontrolle über ihre wahrgenommenen Stimmenidentitäten in einer Weise geben, die zuvor nicht möglich war.
Was sind einige der Anwendungsfälle für die Voicemod-App?
Das Gute an Voicemod ist, dass seine Tools eine Vielzahl von Bedürfnissen und Szenarien abdecken. Die häufigsten Situationen wären für die Erstellung von Inhalten, das Spielen mit Freunden, das Chatten mit Familie oder Freunden, die Erstellung von immersiven Rollenspielen oder sogar für die Arbeit und das Geschäft – wo die Benutzer hauptsächlich unsere Rauschunterdrückung und Audio-Verbesserungstools verwenden.
Könnten Sie einige der Herausforderungen und Vorteile diskutieren, ein Startup mit Geschwistern zu gründen?
Ehrlich gesagt, ich würde gerne, und ich weiß, dass jeder Herausforderungen auf eine bestimmte Weise hat, aber ich kann mich nicht an viele in unserem Fall erinnern. Der Grund dafür ist, dass wir aus einer sehr großen Familie kommen. Wir haben immer etwas zusammen gemacht, von Kindheitsprojekten bis zum Spielen von Musik und Erstellen. Es war nur natürlich, dass wir letztendlich zusammenarbeiten würden. Meine Brüder Fernando und Juan – die, wie ich erwähnt habe, Voicemod zusammen mit mir gegründet haben – hatten bereits mehrere Unternehmen zusammen, also hatten sie in dieser Hinsicht reichlich Erfahrung. Ich trat ihnen 2010 bei, in ihrem Unternehmen, das 2taptap hieß, also bekam ich ein Gefühl dafür. Als wir Voicemod erstellten, taten wir dies vollkommen ausgerichtet auf das, was wir erreichen wollten, und noch wichtiger, wie wir es erreichen wollten. Dies half wirklich, eine starke Kultur von ausgerichteten Werten in Voicemod zu bringen, was der Schlüssel zu unserem Erfolg war.
Gibt es noch etwas, das Sie über Voicemod teilen möchten?
Es gibt viel, was hinter den Kulissen passiert, aber in Übereinstimmung mit unserem Wunsch, den Sound für jeden zu entwickeln, arbeiten wir derzeit an etwas, um unsere Technologie noch zugänglicher zu machen. Eine Möglichkeit für jeden Entwickler, unsere Technologie in seinem Produkt zu verwenden
Wir wissen, dass die Menschen den größten Teil ihrer wachen Zeit online verbringen, angeschlossen, sich auf verschiedenen Plattformen und Anwendungen ausdrücken. In Online-Umgebungen ist Ihr “Avatar” Ihre gesamte Selbstrepräsentation. Und wer ist das, ohne eine Stimme?
Die Entwicklung von Echtzeit-Stimmenveränderungstechnologie und die Entwicklung eines Systems vollständig anpassbarer sonischer Ausdrucksformen ist viel Arbeit. Unser Team hat diesen Schritt aus der Gleichung entfernt, indem es ein ganzes Kit entworfen hat, das leicht von Entwicklern überall integriert werden kann. Wir sind sehr aufgeregt, unsere Technologie für Entwickler und Benutzer auf der ganzen Welt zugänglich zu machen, während wir weiterhin die Zukunft der sozialen Audio-Erfahrungen aufbauen!
Vielen Dank für das großartige Interview, Leser, die mehr erfahren möchten, sollten Voicemod besuchen.












