Інтерв’ю
Яшар Бехзаді, генеральний директор Synthesis AI – Серія інтерв’ю

Яшар Бехзаді, PhD, є генеральним директором і засновником Synthesis AI. Він є досвідченим підприємцем, який створив трансформаційні бізнеси в галузі штучного інтелекту, медичної техніки та IoT-ринку. Він провів останні 14 років у Кремнієвій долині, будуючи та розширюючи компанії, орієнтовані на дані. Яшар має понад 30 патентів і патентів, які очікують реєстрації, та докторський ступінь з Університету Каліфорнії в Сан-Дієго, де його дослідження було зосереджено на просторово-часовому моделюванні функціональної візуалізації мозку.
Synthesis AI – це стартап на перетині глибокого навчання та комп’ютерної графіки, який створює новий парадигму для розробки моделей комп’ютерного зору. Вони дозволяють клієнтам розробляти кращі моделі за частку часу та вартості традиційних підходів, заснованих на анотації людьми.
Як ви спочатку стали займатися комп’ютерними науками та штучним інтелектом?
Я здобув докторський ступінь в Університеті Каліфорнії в Сан-Дієго у 2006 році, де我的 дослідження було зосереджено на комп’ютерному зорі та просторово-часовому моделюванні даних візуалізації мозку. Потім я працював у Кремнієвій долині на перетині датчиків, даних та машинного навчання в різних галузях протягом наступних 16 років. Я відчуваю себе дуже щасливим, що мав можливість працювати над деякими видатними технологіями, і я маю понад 30 патентів, які були видані або подані, зосереджені на обробці сигналів, машинному навчанні та науці про дані.
Чи можете ви поділитися історією створення Synthesis AI?
Перед тим, як заснувати Synthesis AI у 2019 році, я очолював глобальну компанію з послуг штучного інтелекту, яка розробляла моделі комп’ютерного зору для провідних технологічних підприємств. Незалежно від розміру компанії, я виявив, що ми були дуже обмежені якістю та кількістю позначених навчальних даних. Коли компанії розширювалися географічно, збільшували клієнську базу або розробляли нові моделі та апаратне забезпечення, потрібні були нові навчальні дані, щоб забезпечити адекватну роботу моделей. Також стало зрозуміло, що майбутнє комп’ютерного зору не буде успішним з сучасною парадигмою анотації людьми. Нові застосування комп’ютерного зору в автономності, робототехніці та AR/VR/metaverse вимагають багатого набору 3D-міток, інформації про глибину, матеріальні властивості, детальну сегментацію тощо, які люди не можуть позначити. Потрібна була нова парадигма для забезпечення необхідного багатого набору міток для навчання цих нових моделей. Окрім технічних чинників, ми побачили зростаючу увагу споживачів та регуляторів до питань, пов’язаних з етикою моделей та конфіденційністю споживачів.
Я створив Synthesis AI з метою трансформувати парадигму комп’ютерного зору. Платформа компанії з генерації синтетичних даних дозволяє генерувати фотореалістичні дані зображень з розширеним набором 3D-піксельних міток. Наша місія – піонерство в технологіях синтетичних даних для забезпечення етичної розробки більш здатних моделей.
Для читачів, які незнайомі з цим терміном, чи можете ви визначити, що таке синтетичні дані?
Синтетичні дані – це комп’ютерно-генеровані дані, які служать альтернативою реальним даним. Синтетичні дані створюються в симульованих цифрових світах, а не збираються з реального світу. Об’єднуючи інструменти з світу візуальних ефектів та генерації штучного інтелекту, Synthesis AI дозволяє компаніям створювати величезну кількість фотореалістичної, різноманітної даних для навчання моделей комп’ютерного зору. Платформа генерації даних компанії знижує вартість та швидкість отримання високоякісних даних зображень на кілька порядків, зберігаючи конфіденційність.
Чи можете ви обговорити, як синтетичні дані генеруються?
Синтетичний набір даних створюється штучно, а не через реальні дані. Технології з галузі візуальних ефектів поєднуються з генераційними нейронними мережами для створення великої кількості фотореалістичної та різноманітної даних зображень. Синтетичні дані дозволяють створювати навчальні дані за частку часу та вартості традиційних підходів.
Як використання синтетичних даних створює конкурентну перевагу?
Наразі більшість систем штучного інтелекту використовують “наглядане навчання”, де люди позначають ключові атрибути в зображеннях, а потім тренують алгоритми штучного інтелекту для інтерпретації зображень. Це ресурсо- та часоємкий процес, обмежений тим, що люди можуть точно позначити. Крім того, питання щодо упередженості штучного інтелекту та конфіденційності споживачів посилилися, що робить все складніше отримувати репрезентативні дані людини.
Наш підхід полягає у створенні фотореалістичного цифрового світу, який синтезує складні дані зображень. Оскільки ми генеруємо дані, ми знаємо все про сцени, включаючи раніше недоступну інформацію про 3D-розташування об’єктів та їхнє взаємодія з оточенням. Отримання та позначення цього обсягу даних за допомогою традиційних підходів зайняло б місяці, якщо не роки. Ця нова парадигма дозволить досягти 100-кратного покращення ефективності та вартості та сприятиме створенню більш здатних моделей.
Оскільки синтетичні дані генеруються штучно, це усуває багато упереджень та проблем конфіденційності, пов’язаних з традиційним збором даних з реального світу.
Як генерація даних на вимогу дозволяє прискорити масштабування?
Збір та підготовка реальних даних для навчання моделей – це тривалий та трудомісткий процес. Розгортання необхідного апаратного забезпечення може бути надто дорогим для складних систем комп’ютерного зору, таких як автономні транспортні засоби, робототехніка або супутникові зображення. Як тільки дані зібрані, люди позначають та анотують важливі особливості. Цей процес схильний до помилок, а люди обмежені у своїй здатності позначати ключову інформацію, таку як 3D-позиція, необхідна для багатьох застосувань.
Синтетичні дані на кілька порядків швидші та дешевші, ніж традиційні підходи з анотацією людьми, і вони прискорять розгортання нових та більш здатних моделей у різних галузях.
Як синтетичні дані дозволяють зменшити або запобігти упередженості штучного інтелекту?
Системи штучного інтелекту всюди, але вони можуть містити вбудовані упередження, які можуть вплинути на певні групи людей. Набори даних можуть бути несбалансированими з певними класами даних та надабо чи недостATE певних груп людей. Будування людсько-орієнтованих систем часто призводить до упереджень щодо статі, етнічної приналежності та віку. На відміну від цього, штучно створені навчальні дані правильно збалансовані та не містять людських упереджень.
Синтетичні дані можуть стати потужним рішенням для вирішення проблеми упередженості штучного інтелекту. Синтетичні дані генеруються частково або повністю штучно, а не вимірюються або витягуються з реальних подій чи явищ. Якщо набір даних не достатньо різноманітний чи великий, штучно створені дані можуть заповнити прогалини та створити необізнаний набір даних. Найкраще в цьому? Створення цих наборів даних вручну може зайняти команди кілька місяців або років. З синтетичними даними це можна зробити за одну ніч.
Поза комп’ютерним зором, які інші потенційні застосування синтетичних даних?
Окрім багатьох застосувань комп’ютерного зору, пов’язаних з споживчими продуктами, автономністю, робототехнікою, AR/VR/metaverse та іншим, синтетичні дані також вплинуть на інші модальності даних. Ми вже бачимо, як компанії використовують синтетичні дані для структурованих таблиць, голосу та обробки природної мови. Підlying технології та генеративні трубопроводи відрізняються для кожної модальності, і в найближчому майбутньому ми очікуємо побачити багатомодальні системи (наприклад, відео + голос).
Чи є щось інше, що ви хотіли б поділитися про Synthesis AI?
У кінці минулого року ми випустили HumanAPI, значне розширення можливостей синтетичних даних Synthesis AI, яке дозволяє програмно генерувати мільйони унікальних, високоякісних 3D-цифрових людей. Це оголошення відбулося за кілька місяців після запуску продукту FaceAPI, який надав понад 10 мільйонів позначених зображень облич для провідних компаній з виробництва смартфонів, телеконференцій, автомобілів та технологій. HumanAPI – це наступний крок у нашому шляху до підтримки просунутих застосувань штучного інтелекту.
HumanAPI також дозволяє нашим клієнтам створювати нові можливості, включаючи розумні штучні помічники, віртуальні тренери з фітнесу та, звичайно, світ метаверсу.
Створюючи цифровий двійник реального світу, метаверс дозволить нові застосування, починаючи від переосмислених соціальних мереж, розважальних trải nghiệm, телеконференцій, ігор та іншим. Штучний інтелект комп’ютерного зору буде фундаментальним для того, як реальний світ буде захоплений та відтворений з високою точністю в цифровому світі. Фотореалістичні, виразні та поведінкові точні люди будуть важливим компонентом майбутнього застосувань комп’ютерного зору. HumanAPI – це перший продукт, який дозволяє компаніям створювати величезну кількість ідеально позначених даних всього тіла на вимогу для створення більш здатних моделей штучного інтелекту, включаючи оцінку пози, розпізнавання емоцій, характеристику діяльності та поведінки, реконструкцію обличчя та іншим.
Дякуємо за велике інтерв’ю, читачам, які бажають дізнатися більше, слід відвідати Synthesis AI.












