Интервью

Доктор Яир Адато, генеральный директор и основатель Bria – Серия интервью

mm
Добавьте Unite.AI в избранные источники в Google

Доктор Яир Адато, генеральный директор и основатель Bria, является экспертом в области машинного обучения и компьютерного зрения, известным своей способностью соединять передовые технологии с реальными бизнес-приложениями. До основания Bria он занимал должность технического директора Trax Retail, где сыграл ключевую роль в трансформации компании из стартапа с 20 сотрудниками в глобального единорога с более чем 850 сотрудниками. На протяжении своей карьеры Яир также выступал в качестве советника нескольких проектов, основанных на искусственном интеллекте, включая Sparx, Vicomi, Tasq, DataGen и Anima. Его лидерство характеризуется сильной приверженностью ответственной инновации, владению данными и демократизации технологий искусственного интеллекта.

Bria является пионерской компанией в области ответственного визуального генеративного искусственного интеллекта, основанной с миссией создания открытой и этической платформы для генерации изображений. Уникальный подход компании заключается в том, чтобы вознаграждать владельцев данных за их вклады через систему атрибуции, обеспечивая прозрачность и справедливость в экосистеме искусственного интеллекта. Сосредоточившись на творчестве, сотрудничестве и соблюдении требований, Bria наделяет организации возможностью безопасно интегрировать генеративный искусственный интеллект в свои рабочие процессы, устанавливая новые стандарты подотчетности и доверия в индустрии визуального контента.

Вы основали Bria, чтобы создать ответственный и открытый платформу для визуального генеративного искусственного интеллекта. Что вдохновило вас на создание компании, и какие ранние проблемы или идеи определили ее направление?

Я увидел презентацию Гудфеллоу о статье GAN в 2014 году, и сразу стало ясно, что творческая продукция будет изменена фундаментально. Смотря на эту презентацию, последствия были очевидны – это не было просто инкрементным улучшением, это был другой парадигма того, как машины могут учиться генерировать визуальный контент.

Но с самого начала я признал фундаментальный пробел в том, как эти системы были построены: нет ответственности за обучающие данные, нет рамок для ответственного развертывания, нет учета творцов, чья работа сделала все это возможным.

Ранние проблемы не были техническими – они были структурными. Как построить генеративный искусственный интеллект, который улучшает творческую работу без подрыва людей, которые создают? Как сделать эти системы пригодными для использования в производственных средах, где юридическая определенность имеет значение так же, как и качество вывода? Эти вопросы определили все, что мы построили. Мы основали Bria на принципе, что инновации и ответственность не являются противоположными силами – они должны продвигаться вместе, или технология терпит неудачу всем.

Ваш академический фон в области компьютерного зрения и более 50 патентов соединяют исследования и реальную инновацию. Как этот опыт повлиял на техническую дорожную карту и долгосрочную стратегию Bria?

Мой исследовательский фон научил меня думать в системах – как разные слои понимания соединяются, чтобы образовать смысл. Многие из моих патентов сосредоточены на том, как машины интерпретируют структуру визуальной информации, и этот образ мышления естественно перевелся в подход Bria. Мы смотрим на генерацию изображений как на композиционный процесс, а не на случайный.

Но патенты не только о технологии – они о соединении технологии с реальной бизнес-реальностью. Значительная часть нашего портфеля интеллектуальной собственности касается системного уровня: как создать рамки атрибуции, которые соединяют сгенерированный контент с его источниками обучения? Как построить экономические модели, которые компенсируют творцам в масштабе? Это не являются чисто техническими проблемами – это вопросы инфраструктуры, бизнес-моделей и рыночного дизайна.

Этот более широкий взгляд сформировал нашу долгосрочную стратегию. Инновации не только о продвижении основных моделей. Это о создании новых экономических структур, новых договорных рамок, новых способов для индустрии работать устойчиво. Цель не только в производстве лучших результатов – это в понимании того, как эти результаты формируются, кто внес вклад в них и как ценность течет через систему. Это место, где наука встречается с продуктивным мышлением и бизнес-архитектурой.

Bria только что объявила о FIBO, описанном как первый детерминированный визуальный фундаментальный модель для профессиональной генерации искусственного интеллекта. Что делает FIBO фундаментально другим от существующих визуальных систем искусственного интеллекта?

Само название сигнализирует наш подход: FIBO означает Фибоначчи, математическую последовательность, знаменитую своими внутренними эстетическими свойствами. Золотое соотношение – соотношение между последовательными числами в последовательности Фибоначчи – возникает в том, что мы воспринимаем как визуально приятные пропорции по математике, визуальному искусству, геометрии и архитектуре. Вы видите это в размерах римского Пантеона и Белого дома, в человеческом теле и лице, проиллюстрированном в работе Леонардо да Винчи “Витрувианский человек”, и во всей природе. Эта связь между математической структурой и визуальной красотой – это именно то, что воплощает FIBO: эстетическое качество через формальную структуру.

FIBO меняет отношение между намерением и выводом. Большинство визуальных систем искусственного интеллекта вставляют слои интерпретации между тем, что вы хотите, и тем, что получаете – вы пишете подсказку, модель переводит ее через языковые кодировщики, диффундирует через шум, и вы надеетесь, что результат соответствует вашему видению. FIBO удаляет эти слои полностью.

Мы сделали визуальный искусственный интеллект работать как код – каждый творческий элемент становится редактируемым и повторяемым. Это прорыв для профессионалов, которые были застряны с “рулеткой подсказок”. Это означает, что каждый элемент, направление освещения, угол камеры, цветовая палитра, композиция, стиль существует как явная, контролируемая свойство. JSON-структура позволяет вам изменить только те параметры, которые вы хотите, при этом блокируя все остальные. Вы можете регулировать интенсивность освещения без влияния на композицию или сдвигать угол камеры без изменения цветовой палитры. Система делает именно то, что вы указываете, каждый раз.

Мы проводим хакатоны с Fal и NVIDIA (NVDA ), чтобы показать разработчикам, как детерминированная генерация работает на практике. Сама JSON-структура открывает черный ящик – вы можете увидеть точно, какие параметры создали изображение, воспроизвести его и изменить с точностью. Это совершенно другой парадигма, чем инженерия подсказок.

Традиционные системы текст-изображение полагаются на все более сложные подсказки, чтобы достичь конкретных результатов. Как подход FIBO решает проблему сложности подсказок?

Две проблемы нужно решить. Во-первых, проблемы случайности подсказок существуют, потому что текущие модели пытаются извлечь намерение пользователя и добавить то, что модель “думает” является эстетически желательным или желательным через улучшение подсказок. Во-вторых, отсутствие контроля над профессиональными свойствами.

FIBO инвертирует это. Модель была обучена на более чем 1000-словных визуальных описаниях на изображение, которые явно кодируют более 100 независимых атрибутов в формате JSON. Это не было постобработано или извлечено – это был родной формат обучения. Поскольку каждый атрибут представлен структурно с самого начала, модель научилась визуальной композиции как набору дискретных, контролируемых параметров, а не как размытой интерпретации текста.

Это означает, что на практике вы определяете эстетическое намерение через структуру, а не через “подсказку и молитву”. Уровень соответствия текст-изображение фундаментально выше, потому что нет слоя перевода. Вы говорите на родном языке модели. И поскольку свойства независимы, вы можете итерировать освещение без случайного изменения композиции или регулировать цветовую палитру без влияния на стиль. Контроль хирургический.

FIBO вводит “урежиссированный” рабочий процесс, который отличается от типичной итеративной генерации. Как это меняет подход профессионалов к визуальному производству?

Большинство генеративных рабочих процессов итеративны в раздражающей форме – вы генерируете, оцениваете, регулируете подсказку, генерируете снова, надеясь, что это ближе. это “подсказка и молитва”. Вы никогда не знаете точно, что изменилось или почему.

Уточнение превращает экспериментирование в дизайн. Вы не угадываете, что может сделать новая подсказка – вы управляете изображением точно так же, как вы бы настроили свет или цвет в Photoshop. . Вам не нужно работать на уровне JSON напрямую – модель видения-языка изменяет JSON для вас на основе естественных языковых инструкций. Но сам JSON позволяет вам понять точно, что произошло. Вы генерируете начальное изображение, изучаете его JSON-представление, определяете, какие свойства необходимо скорректировать – может быть, интенсивность освещения слишком высока или угол камеры должен сдвинуться на 15 градусов – и вы изменяете только эти значения через простые инструкции. Все остальное остается заблокированным.

Эта структура идеальна для агентских рабочих процессов. Искусственный интеллект-агент может проанализировать JSON, понять полное состояние изображения, сделать целевые изменения и объяснить свою логику – все потому, что параметры явные и интерпретируемые. Агент не угадывает, что может сделать изменение подсказки; он делает точные корректировки известных свойств.

Это удаляет непредсказуемость, которая держала профессионалов скептическими по отношению к генеративному искусственному интеллекту. Когда вы можете увидеть полный набор параметров, который создал изображение, понять, что контролирует каждое свойство, и изменить отдельные атрибуты с уверенностью, что ничего другого не изменится, вы больше не экспериментируете – вы проектируете. Видимость JSON открывает черный ящик полностью. Для профессиональных производственных рабочих процессов, где последовательность и контроль имеют значение больше, чем новизна, это разница между творческой игрушкой и инструментом производства.

Этика данных и безопасность бренда стали центральными для корпоративного искусственного интеллекта. Как использование Bria полностью лицензированных, очищенных от прав данных обеспечивает как соблюдение требований, так и уважение к интеллектуальной собственности создателей?

С первого дня мы решили, что если индустрия будет расти ответственно, она должна начаться с целостности данных. Каждое изображение, которое обучило FIBO, поступает из лицензированных, очищенных от прав источников через партнерство с лидерами контента, такими как Getty Images (GETY ) и Envato. Это обеспечивает, что наши модели являются соответствующими и справедливыми. Мы видим уважение к создателям как часть цепочки создания ценности, а не как ограничение. Корпорации выигрывают от этой целостности, потому что она дает им юридическую и этическую уверенность, необходимую для масштабирования с уверенностью.

FIBO был обучен, чтобы узнать уникальный стиль и идентичность каждой компании. Как эта способность меняет подход глобальных брендов к созданию контента и визуальной последовательности?

Бренды имеют свою визуальную ДНК – уникальный способ выражения эмоций, доверия и цели через дизайн. FIBO может научиться этому языку. Как только он обучен, он генерирует визуальные элементы, которые отражают ту же композицию, тон и атмосферу, которые определяют идентичность бренда. Это превращает искусственный интеллект из творческого помощника в актив бренда. Это помогает глобальным командам создавать с выравниванием, а не приближением. Результатом является последовательность в масштабе без потери индивидуальности.

С ранними адоптерами, уже использующими FIBO для автоматизации дизайна упаковки, продукции и творческих кампаний, какие результаты или отзывы были наиболее заметными для вас на данный момент?

Сдвиг в мышлении. Команды начинают рассматривать искусственный интеллект как часть своего операционного инструментария, а не как новинку. Одна глобальная марка генерирует региональные варианты упаковки намного быстрее, сохраняя при этом последовательность бренда. Ведущее творческое агентство ускорило разработку кампаний в десять раз благодаря контролируемой итерации. Но настоящий сигнал исходит от творческих директоров, которые говорят нам, что они чувствуют себя более контролирующими; что модель понимает их визуальное намерение. Это поворотный момент для индустрии.

Bria позиционирует себя как лидера в этичном и контролируемом искусственном интеллекте. Как вы видите, как эта философия формирует будущие правила или отраслевые стандарты для визуального искусственного интеллекта?

Мы достигли стадии, где инновации и управление должны двигаться вместе. Регулирование не является препятствием, а скорее инфраструктурой для устойчивого роста. Наш подход – прозрачные данные, детерминированные выводы, ясное происхождение – соответствует тому, что запрашивают возникающие политики. Я считаю, что мы увидим новые стандарты, которые отдают приоритет прослеживаемости, объяснимости и защите прав. Философия Bria заключается в том, чтобы помочь определить эти стандарты через практику, а не заявления о политике.

Оглядываясь вперед, что дальше для Bria после FIBO? Вы представляете себе расширение в области многомодального искусственного интеллекта, который объединяет изображение, видео и 3D-генерацию под одной контролируемой рамкой?

Да. Те же принципы, которые обеспечивают FIBO – структура, контроль, прозрачность – применяются во всех визуальных доменах. Мы уже исследуем расширения в видео и 3D, где детерминизм может принести ту же надежность, которую корпорации сейчас имеют с изображениями. Наша цель проста: сделать творчество искусственного интеллекта таким же контролируемым и безопасным, как написание кода – и распространить это на каждый визуальный средству, от изображения до видео до 3D.

Спасибо за отличное интервью, читатели, которые хотят узнать больше, должны посетить Bria.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.