Інтерв’ю
Тайлер Вейцман, співзасновник та голова відділу штучного інтелекту в Speechify – Серія інтерв’ю

Тайлер Вейцман є співзасновником, головою штучного інтелекту та президентом компанії Speechify, яка є найкращим текст-у-голос застосунком у світі, з понад 100 000 відгуків з 5 зірками. Вейцман є випускником Стенфордського університету, де він отримав ступінь бакалавра з математики та магістра з комп’ютерних наук на напрямку штучного інтелекту. Його було обрано одним з 50 найкращих підприємців за версією журналу Inc., а також він був представлений у виданнях Business Insider, TechCrunch, LifeHacker, CBS та інших. Дослідження Вейцмана під час роботи над магістерською роботою було зосереджено на штучному інтелекті та текст-у-голос технології, а його остання робота мала назву: “CloneBot: персоналізовані передбачення діалогів-відповідей”.
Ви почали програмування у віці 9 років, що спочатку привернуло вашу увагу до комп’ютерних наук?
Я був досить одержимий як дитина мультфільмом “Дракон Болл Зет”, і я хотів навчитися анімувати сам. Я вивчив Adobe (ADBE ) Flash і Photoshop і розмістив свої власні анімації Гоку на фан-сайті, який я створив. Незабаром після цього я почав вивчати системи та алгоритми, і коли я дізнався, що можна програмувати для заробітку, це було досить цікаво. Я думав, що це просто хобі, як гра у відеоігри.
Потім ви почали створювати застосунки для iPhone у віці 12 років, які були деякими з цих застосунків?
Одним з таких застосунків є Black SMS, який дозволяє людям відправляти зашифровані текстові повідомлення один одному. Іншим застосунком був Frontback, який дозволяє користувачам робити селфі та фотографії того, що відбувається перед ними в одночасно.
Чи можете ви розповісти про свої дослідження у Стенфордському університеті та про те, як вони були зосереджені на обробці природної мови та синтезі мови?
Моє дослідження охоплювало кілька застосунків трансформерних мереж, включаючи моделі генерації мови для чату, позначення частин мови, передбачення пунктуації та текст-у-голос. Оптимізація висновків нейронних мереж для мобільних ЦП була основним напрямком роботи, який безпосередньо переклався на офлайн-голоси, доступні у Speechify, які працюють навіть у режимі літака.
Чи можете ви розповісти про історію створення Speechify?
Я сліпий на одне око, а мій брат Кліфф є дислексиком. Ми використовували аудіокниги та текст-у-голос технологію протягом всього життя, щоб проходити школу та читати книги, такі як “Гаррі Поттер”, коли ми були молодими. Коли ми стали старшими та почали використовувати більше технологічних продуктів, ми зрозуміли, що є можливість створити кращі текст-у-голос застосунки на веб та мобільних пристроях з кращими голосами завдяки вдосконаленням у штучному інтелекті та кращому користувальницькому досвіді. Тому ми вирішили зробити це у Speechify.
Які деякі з різних машинних навчальних технологій, які використовуються у Speechify?
Ми прийняли передові техніки для генерації архітектур — трансформери/конформери, великомасштабне попереднє навчання, розподілене навчання, накопичення градієнтів, авто-кодовані латентні простори, дифузія, антагоністичні мережі та мовна модель. Ми використовуємо допоміжні техніки для обробки функцій навколо фонемізації, висоти та емоцій, щоб краще змоделювати мову.
Які деякі з викликів при створенні текст-у-голос застосунку?
Одним з ключових викликів є створення високоякісних голосів, які звучать як справжні люди, а не роботи. Наша мета полягає в тому, щоб люди не могли відрізнити, як наші голоси звучать порівняно з людьми, щоб наші користувачі були комфортні, слухаючи контент у Speechify протягом тривалого часу. Другим викликом є розповсюдження наших моделей штучного інтелекту серед мільйонів користувачів. Це одна справа — створити високоякісні голоси штучного інтелекту, а інша справа — забезпечити, щоб мільйони користувачів у світі дізналися про них та використовували їх.
Speechify є найкращим застосунком у своїй категорії в апсторі, до чого ви приписуєте цей успіх?
Ми вважаємо, що ми створили найкращі продукти на ринку для людей, які хочуть слухати те, що їм потрібно читати — чи то студенти з домашнім завданням, чи професіонали, які читають для роботи, чи читачі-дозвілля, які просто хочуть розважитися. У нас є найкращий вибір голосів, включаючи знаменитостей, таких як Снуп Догг, та найкращий інтерфейс користувача для людей, щоб легко завантажувати та отримувати доступ до контенту, який вони хочуть споживати. А наш користувальницький досвід є безшовним у всьому екосистемі Speechify — ви можете почати слухати статтю на вашому комп’ютері, а потім легко перейти до прослуховування на вашому телефоні.
Які деякі з найбільших випадків використання цього застосунку?
Генеративний штучний інтелект Speechify вирішує реальні проблеми для студентів, які хочуть швидше проходити домашнє завдання, реальних людей з дислексією та СДУГ, які мають труднощі з читанням, людей похилого віку з низькою зором, професіоналів, які хочуть читати більше та бути більш продуктивними, письменників, які хочуть слухати свою роботу, аудіо-учнів та багатьох інших.
Яка ваша бачення майбутнього штучного інтелекту?
Ми хочемо, щоб штучний інтелект — і зокрема голоси штучного інтелекту — усунули бар’єри для навчання незалежно від вашого рівня доходу, відмінностей у навчанні, географічного положення чи мови. Ми бачимо штучний інтелект як інструмент соціальної добробути, який підвищує якість життя людей шляхом поліпшення їхньої освіти.
Дякуємо за велике інтерв’ю, читачам, які хочуть дізнатися більше, слід відвідати Speechify.












