Interviews
Tyler Weitzman, Co-Founder & Head of AI at Speechify – Interview-Serie

Tyler Weitzman ist Co-Founder, Head of Artificial Intelligence und Präsident bei Speechify, der Nr. 1-Text-to-Speech-App der Welt, mit über 100.000 5-Sterne-Bewertungen. Weitzman ist Absolvent der Stanford University, wo er einen Bachelor-Abschluss in Mathematik und einen Master-Abschluss in Informatik mit Schwerpunkt Künstliche Intelligenz erwarb. Er wurde von Inc. Magazine als einer der Top 50-Unternehmer ausgewählt und in Publikationen wie Business Insider, TechCrunch, LifeHacker und CBS vorgestellt. Weitzmans Master-Arbeit konzentrierte sich auf künstliche Intelligenz und Text-to-Speech, und sein Abschlusspaper trug den Titel: “CloneBot: Personalisierte Dialog-Antwort-Vorhersagen”.
Sie haben mit dem Programmieren im Alter von 9 Jahren begonnen, was hat Sie ursprünglich zur Informatik hingezogen?
Ich war als Kind ziemlich besessen von Dragon Ball Z und wollte lernen, selbst zu animieren. Ich lernte Adobe (ADBE ) Flash und Photoshop und veröffentlichte meine eigenen Animationen von Goku auf einer von mir erstellten Fan-Website. Kurz danach begann ich, über Systeme und Algorithmen zu lernen, und als ich erfuhr, dass ich tatsächlich für den Lebensunterhalt programmieren konnte, war das ziemlich aufregend. Ich dachte, es sei nur ein Hobby wie das Spielen von Spielen.
Sie haben dann im Alter von 12 Jahren mit dem Bau von iPhone-Apps begonnen, welche Apps waren das?
Eine App heißt Black SMS, die es Menschen ermöglicht, verschlüsselte Textnachrichten zu senden. Eine weitere App hieß Frontback, die es Benutzern ermöglicht, Selfies und Fotos von dem zu machen, was vor ihnen liegt, gleichzeitig.
Können Sie über Ihre Forschung an der Stanford University sprechen und wie sie sich auf die Verarbeitung natürlicher Sprache und Sprachsynthese konzentrierte?
Meine Forschung umfasste mehrere Anwendungen für Transformer-Netzwerke, einschließlich Sprachgenerierungsmodellen für Chat, Teil-of-Speech-Tagging, Punktuationsvorhersage und Text-to-Speech. Die Optimierung von neuronalen Netzen für mobile CPUs war ein Hauptaugenmerk und das übersetzte sich direkt in die Offline-Stimmen, die in Speechify verfügbar sind und sogar im Flugmodus funktionieren.
Können Sie die Entstehungsgeschichte hinter Speechify teilen?
Ich bin auf einem Auge blind und mein Bruder Cliff ist dyslektisch. Wir haben Audiobücher und Text-to-Speech-Audio-Technologie seit jeher verwendet, um durch die Schule zu kommen und als junge Leute Bücher wie Harry Potter zu lesen. Als wir älter wurden und mehr Technologie-Produkte verwendeten, begannen wir, zu realisieren, dass es eine Chance gab, bessere Text-to-Speech-Apps auf Web und Mobile mit besseren Stimmen dank Fortschritten in KI und einer besseren Benutzeroberfläche zu bauen. Also beschlossen wir, es zu tun, in Speechify.
Welche verschiedenen maschinellen Lern-Technologien werden bei Speechify verwendet?
Wir haben fortschrittliche Techniken für erweiterte generative Architekturen übernommen – Transformer/Conformer, groß angelegte Vorverarbeitung, verteiltes Training, Gradientenakkumulation, auto-kodierte latente Räume, Diffusion, antagonistische Netzwerke und Sprachmodellierung. Wir verwenden unterstützende Techniken für die Verarbeitung von Funktionen im Zusammenhang mit Phonemisierung, Tonhöhe und Emotion, um die Sprache besser zu modellieren.
Welche Herausforderungen gibt es beim Bau einer Text-to-Speech-App?
Eine der wichtigsten Herausforderungen ist der Bau von hochwertigen Stimmen, die wie echte Menschen und nicht wie Roboter klingen. Unser Ziel ist es, dass Menschen nicht erkennen können, ob unsere Stimmen wie menschliche Stimmen oder wie Roboter klingen, damit unsere Benutzer sich wohlfühlen, wenn sie Inhalte auf Speechify über einen längeren Zeitraum hören. Eine zweite Herausforderung ist die Verteilung unserer KI-Modelle an Millionen von Benutzern. Es ist eine Sache, hochwertige KI-Stimmen zu bauen, und eine andere, sicherzustellen, dass Millionen von Benutzern auf der ganzen Welt tatsächlich davon erfahren und sie verwenden.
Speechify ist die Nr. 1-App in ihrer Kategorie im App Store, was tragen Sie diesen Erfolg zu?
Wir glauben, dass wir die besten Produkte auf dem Markt für Menschen gebaut haben, die das Lesen benötigen, das sie konsumieren müssen – sei es Studenten mit Hausaufgaben, Fachleute, die für die Arbeit lesen, oder Freizeitleser, die einfach nur unterhalten werden möchten. Wir haben die beste Auswahl an Stimmen, einschließlich Berühmtheiten wie Snoop Dogg, und die beste Benutzeroberfläche, damit Menschen leicht auf den Inhalt zugreifen können, den sie konsumieren möchten. Und unsere Benutzeroberfläche ist nahtlos über das Speechify-Ökosystem – Sie können mit dem Hören eines Artikels auf Ihrem Computer beginnen und dann leicht zu Ihrem Hören auf Ihrem Telefon wechseln.
Welche sind einige der größten Anwendungsfälle für diese App?
Speechifys generative KI löst reale Probleme für Studenten, die ihre Hausaufgaben schneller erledigen möchten, echte Menschen mit Dyslexie und ADHS, die Schwierigkeiten beim Lesen haben, Senioren mit schlechter Sehkraft, Fachleute, die mehr lesen und produktiver sein möchten, Schriftsteller, die ihre Arbeit hören möchten, auditive Lerner und viele andere.
Was ist Ihre Vision für die Zukunft der KI?
Wir möchten, dass KI – und insbesondere KI-Text-to-Speech-Stimmen – Barrieren für das Lernen beseitigt, unabhängig von Ihrem Einkommensniveau, Lernunterschieden, geografischem Standort oder Sprache. Wir sehen KI als ein Werkzeug für das soziale Wohl, um die Lebensqualität zu erhöhen, die Menschen durch die Verbesserung ihrer Bildung erreichen können.
Vielen Dank für das großartige Interview, Leser, die mehr erfahren möchten, sollten Speechify besuchen.












