Інтерв’ю

Доктор Яїр Адато, генеральний директор і засновник Bria – Серія інтерв’ю

mm
Додайте Unite.AI до бажаних джерел у Google

Доктор Яїр Адато, генеральний директор і засновник Bria, є експертом у галузі машинного навчання та комп’ютерного зору, визнаним за свою здатність поєднувати передову технологію з реальними бізнес-застосуваннями. До заснування Bria він обіймав посаду технічного директора Trax Retail, де відіграв центральну роль у перетворенні компанії з 20-осібної стартапу у глобального єдинорога з понад 850 співробітниками. На протяженні своєї кар’єри Яїр також брав участь як радник у кількох проектах, пов’язаних з штучним інтелектом, включаючи Sparx, Vicomi, Tasq, DataGen та Anima. Його лідерство характеризується сильним зобов’язанням щодо відповідальності, інновацій, власності даних та демократизації технологій штучного інтелекту.

Bria є піонерською компанією у сфері відповідальності візуального генераційного штучного інтелекту, заснованої з місією створення відкритої та етичної платформи для генерації зображень. Унікальний підхід компанії полягає у винагоді власників даних за їх внесок через механізм атрибуції, що забезпечує прозорість та справедливість у екосистемі штучного інтелекту. Зосереджуючись на творчості, співробітництві та дотриманні законодавства, Bria надає організаціям можливість безпечно інтегрувати генераційний штучний інтелект у свої робочі процеси, встановлюючи нові стандарти відповідальності та довіри у сфері візуального контенту..

Ви заснували Bria, щоб створити відповідальну та відкриту платформу для візуального генераційного штучного інтелекту. Що надихнуло вас на створення компанії, і які ранні виклики чи ідеї сформували її напрямок?

Я бачив виступ Гудфеллоу про роботу GAN у 2014 році, і одразу стало зрозуміло, що творча продукція зміниться фундаментально. Дивлячись на цю презентацію, наслідки були очевидними – це не був просто інкрементальний поліпшення, а зовсім інший парадигма того, як машини можуть вивчити генерацію візуального контенту.

Але з самого початку я визнав фундаментальну прогалину у тому, як ці системи будувалися: жодної відповідальності за дані навчання, жодного каркаса для відповідальності розгортання, жодної уваги до творців, чиї роботи зробили все можливим.

Ранні виклики не були технічними – вони були структурними. Як створити генераційний штучний інтелект, який підвищує творчу роботу без підірвання людей, які створюють? Як зробити ці системи придатними для використання у виробничих середовищах, де юридична певність має значення не менше, ніж якість виходу? Ці питання сформували все, що ми побудували. Ми заснували Bria на принципі, що інновації та відповідальність не є протилежними силами – вони повинні розвиватися разом, або технологія не вдаватиме нікого.

Ваш академічний досвід у галузі комп’ютерного зору та понад 50 патентів сприяють поєднанню досліджень та реальної інновацій. Як цей досвід вплинув на технічну дорогу та довгострокову стратегію Bria?

Мій дослідницький досвід навчив мене думати у системах – як різні шари розуміння з’єднуються, щоб утворити сенс. Багато моїх патентів зосереджені на тому, як машини інтерпретують структуру візуальної інформації, і цей спосіб мислення природно перейшов у підхід Bria. Ми розглядаємо генерацію зображень як композиційний процес, а не випадковий.

Але патенти не лише про технології – вони про те, як технології поєднуються з реальністю бізнесу. Значна частина нашого портфеля інтелектуальної власності стосується шару систем: як створити каркас атрибуції, який з’єднує згенерований контент з його джерелами навчання? Як побудувати економічні моделі, які компенсують творцям у масштабі? Це не просто технічні проблеми – це питання інфраструктури, бізнес-моделей та ринкової конструкції.

Цей ширший погляд сформував нашу довгострокову стратегію. Інновації не лише про те, щоб просунути основні моделі. Це про створення нових економічних структур, нових договорних каркасів, нових способів того, як галузь може працювати устойчиво. Метою не є лише поліпшення результатів – це зрозуміти, як ці результати утворюються, хто до них внесла свій внесок, і як цінність протікає через систему. Це місце, де наука зустрічається з продуктом мислення та бізнес-архітектурою.

Bria刚 оголосила про FIBO, описаний як перший детермінірований візуальний фундаментальний модель для професійної генерації штучного інтелекту. Що робить FIBO фундаментально іншим від існуючих візуальних систем штучного інтелекту?

Сама назва сигналізує наш підхід: FIBO означає Фібоначчі, математичну послідовність, знамениту своїми внутрішніми естетickými властивостями. Золотий перетин – відношення між послідовними числами у послідовності Фібоначчі – виникає у тому, що ми сприймаємо як візуально привабливі пропорції у математиці, візуальному мистецтві, геометрії та архітектурі. Ви бачите це у розмірах римського Пантеону та Білого дому, у людському тілі та обличчі, як ілюструє Леонардо да Вінчі у своєму Вітрувіанському чоловікові, та у природних формах. Ця зв’язок між математичною структурою та візуальною красою саме те, що FIBO втілює: естетична якість через формальну структуру.

FIBO змінює відношення між наміром та виходом. Більшість візуальних систем штучного інтелекту вставляють шари інтерпретації між тим, що ви хочете, та тим, що ви отримуєте – ви пишете запит, модель перекладає його через мовні кодувальники, дифузує через шум, і ви сподіваєтеся, що результат відповідає вашому баченню. FIBO усуває ці шари зовсім.

Ми зробили візуальний штучний інтелект подібним до коду – кожен творчий елемент стає редагованим та повторюваним. Це прорив для професіоналів, які були застрягли з “рулеткою запиту”. Це означає, що кожен елемент, напрям освітлення, кут камери, палітра кольорів, композиція, стиль існує як явна, контрольована властивість. JSON-структура дозволяє вам змінити лише ті параметри, які ви хочете, тоді як інші залишаються заблокованими.

Ми проводимо хакатони з Fal та NVIDIA (NVDA ), щоб показати розробникам, як детермінована генерація працює на практиці. Сама JSON-структура відкриває чорну скриньку – ви можете бачити точно, які параметри створили зображення, відтворити його та змінити з точністю. Це зовсім інша парадигма, ніж інженерія запиту.

Традиційні тексти-до-зображення системи залежать від все більш складних запитів, щоб досягти конкретних результатів. Як підхід FIBO вирішує проблему складності запиту?

Дві проблеми потрібно вирішити. По-перше, проблеми випадковості запитів існують, оскільки поточні моделі намагаються витягти намір користувача та додати те, що модель “вважає” естетичним або бажаним через підсилення запиту. По-друге, відсутність контролю над професійними властивостями

FIBO інвертує це. Модель була навчена на більш ніж 1000-словних візуальних описах на зображення, які явно кодують понад 100 незалежних атрибутів у форматі JSON. Це не було постпроцесовано чи витягнуто – це був вихідний формат навчання. Через те, що кожен атрибут представлений структурно з початку, модель навчилася візуальної композиції як набору дискретних, контрольованих параметрів, а не як розмитої інтерпретації тексту.

Це означає, що на практиці ви визначаєте естетичний намір через структуру, а не через “запит і молитися”. Рівень текст-до-зображення відповідності фундаментально вищий, оскільки немає шару перекладу. Ви розмовляєте рідною мовою моделі. І через те, що властивості незалежні, ви можете ітерувати освітлення без випадкової зміни композиції або регулювати палітру кольорів без впливу на стиль. Контроль є хірургічним.

FIBO вводить “виправлення” робочий процес, який відрізняється від типової ітеративної генерації. Як це змінює підхід професіоналів до візуальної продукції?

Більшість генераційних робочих процесів ітеративні у розчарувальному сенсі – ви генеруєте, оцінюєте, регулюєте свій запит, генеруєте знову, сподіваючись, що це ближче. це “запит і молитися”. Ви ніколи не знаєте точно, що змінилося або чому.

Виправлення перетворює експериментування у дизайн. Ви не гадаєте, що новий запит може зробити – ви керуєте зображенням точно так, як ви налаштували б світло або колір у Photoshop. . Ви не需要 працювати на рівні JSON безпосередньо – модель мови-бачення змінює JSON для вас на основі природної мови інструкцій. Але сам JSON дозволяє вам зрозуміти точно, що відбулося. Ви генеруєте початкове зображення, оглядаєте його JSON-представлення, визначаєте, які властивості потрібно регулювати – можливо, інтенсивність освітлення занадто висока, або кут камери потрібно зсунути на 15 градусів – і ви змінюєте лише ці значення через прості інструкції. Все інше залишається заблокованим.

Ця структура ідеальна для агентських робочих процесів. Штучний інтелект-агент може аналізувати JSON, зрозуміти повний стан зображення, зробити цілеве регулювання та пояснити свою логіку – все через те, що параметри явні та інтерпретовані. Агент не гадає, що зміна запиту може зробити; він робить точні регулювання відомих властивостей.

Це усуває непередбачуваність, яка тримала професіоналів скептичними щодо генераційного штучного інтелекту. Коли ви можете бачити повний набір параметрів, який створив зображення, зрозуміти, що кожна властивість контролює, та змінити окремі атрибути з впевненістю, що нічого іншого не зрушить, ви не експериментуєте – ви проектуєте. Видимість JSON відкриває чорну скриньку повністю. Для професійної продукції, де консистентність та контроль мають значення більше, ніж новизна, це різниця між творчою іграшкою та інструментом виробництва.

Етика даних та безпека бренду стали центральними для корпоративного штучного інтелекту. Як використання Bria повністю ліцензованих, очищених даних забезпечує як відповідність, так і повагу до інтелектуальної власності творців?

З першого дня ми вирішили, що якщо галузь мала розвиватися відповідально, вона мала починатися з цілісності даних. Кожне зображення, яке навчало FIBO, походило з ліцензованих, очищених джерел через партнерство з лідерами контенту, такими як Getty Images (GETY ) та Envato. Це забезпечує, що наші моделі є відповідними та чесними. Ми розглядаємо повагу до творців як частину ланцюга цінності, а не обмеження. Корпорації виграють від цієї цілісності, оскільки вона дає їм юридичну та етичну певність, необхідну для масштабування з впевненістю.

FIBO був навчений вивчати унікальний стиль та ідентичність кожного підприємства. Як ця здатність змінює підхід глобальних брендів до створення контенту та візуальної консистентності?

Бренди мають свою візуальну ДНК – унікальний спосіб вираження емоцій, довіри та мети через дизайн. FIBO може вивчити цю мову. Після навчання він генерує візуальні ефекти, які відображають ту саму композицію, тон та атмосферу, які визначають ідентичність бренду. Це перетворює штучний інтелект з творчої помічниці у бренд-актив. Це допомагає глобальним командам створювати з узгодженням, а не наближенням. Результатом є консистентність у масштабі без втрати індивідуальності.

З ранніми приймачами, які вже використовують FIBO для автоматизації дизайну пакування, продукційної зображення та творчих кампаній, які результати чи відгуки були найбільш вражаючими для вас?

Зміна у мисленні. Команди починають розглядати штучний інтелект як частину свого операційного інструментарію, а не як новинку. Одна глобальна марка генерує регіональні варіанти пакування набагато швидше, зберігаючи при цьому консистентність бренду. Інша провідна творча агенція прискорила розвиток кампанії у десять разів завдяки контрольованій ітерації. Але справжній сигнал надходить від творчих директорів, які кажуть нам, що вони почувають себе більш контрольованими; що модель розуміє їхній візуальний намір. Це переломний момент для галузі.

Bria позиціонує себе як лідера у сфері етичного та контрольованого штучного інтелекту. Як ви бачите, що ця філософія формуватиме майбутні регуляції чи галузеві стандарти для візуального штучного інтелекту?

Ми досягли стадії, на якій інновації та управління повинні рухатися разом. Регуляція не є перешкодою, а радше інфраструктурою для сталий росту. Наш підхід – прозорі дані, детерміновані виходи, ясна походження – відповідає тому, що запитують нові політики. Я вірю, що ми побачимо нові стандарти, які віддають пріоритет слідуваності, пояснюваності та захисту прав. Філософія Bria полягає у тому, щоб допомогти визначити ці стандарти через практику, а не заяви про політику.

Оглядаючи вперед, що наступного для Bria після FIBO? Чи бачите ви розширення у напрямку багатомодального штучного інтелекту, який об’єднує генерацію зображень, відео та 3D під одним контрольованим каркасом?

Так. Ті самі принципи, які живлять FIBO – структура, контроль, прозорість – застосовуються до всіх візуальних доменів. Ми вже досліджуємо розширення у напрямку відео та 3D, де детермінізм може принести ту саму надійність, яку підприємства зараз мають з зображеннями. Наша мета проста: зробити творчість штучного інтелекту такою ж контрольованою та безпечною, як написання коду – і розширити це на кожний візуальний засіб, від зображення до відео до 3D.

Дякую за велике інтерв’ю, читачам, які бажають дізнатися більше, рекомендуємо відвідати Bria.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.