Wywiady

Dr Yair Adato, CEO i założyciel Bria – seria wywiadów

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Dr Yair Adato, CEO i założyciel Bria, jest ekspertem w dziedzinie uczenia maszynowego i widzenia komputerowego, znany ze swojej zdolności łączenia zaawansowanej technologii z realnymi aplikacjami biznesowymi. Przed założeniem Bria pełnił funkcję CTO w Trax Retail, gdzie odegrał kluczową rolę w przekształceniu firmy z 20-osobowego startupu w globalnego jednorożca z ponad 850 pracownikami. W trakcie swojej kariery Yair doradzał również kilku przedsięwzięciom opartym na sztucznej inteligencji, w tym Sparx, Vicomi, Tasq, DataGen i Anima. Jego przywództwo cechuje się silnym zaangażowaniem w odpowiedzialną innowację, własność danych i demokratyzację technologii sztucznej inteligencji.

Bria to pionierska firma w dziedzinie odpowiedzialnego generatywnego sztucznej inteligencji wizualnej, założona z misją stworzenia otwartej i etycznej platformy do generowania obrazów. Unikalne podejście firmy nagradza właścicieli danych za ich wkład poprzez silnik atrybucji, zapewniając przejrzystość i uczciwość w ekosystemie sztucznej inteligencji. Koncentrując się na kreatywności, współpracy i zgodności, Bria umożliwia organizacjom bezpieczne włączanie generatywnej sztucznej inteligencji do swoich procesów roboczych, ustanawiając nowe standardy odpowiedzialności i zaufania w branży treści wizualnych..

Założyłeś Bria, aby stworzyć odpowiedzialną i otwartą platformę do generatywnej sztucznej inteligencji wizualnej. Co skłoniło Cię do założenia firmy, a jakie wczesne wyzwania lub spostrzeżenia ukształtowały jej kierunek?

Zobaczyłem, jak Goodfellow przedstawił pracę o GAN w 2014 roku, i było natychmiast jasne, że produkcja kreatywna ulegnie fundamentalnej zmianie. Obserwując tę prezentację, implikacje były oczywiste — to nie było tylko stopniowe ulepszenie, ale inny paradygmat dla tego, jak maszyny mogą się uczyć generować treści wizualne.

Ale od samego początku rozpoznałem fundamentalną lukę w tym, jak te systemy były budowane: brak odpowiedzialności za dane szkoleniowe, brak ram dla odpowiedzialnego wdrożenia, brak uwzględnienia twórców, których praca umożliwiła to wszystko.

Wczesne wyzwania nie były techniczne — były strukturalne. Jak zbudować generatywną sztuczną inteligencję, która wspiera pracę kreatywną, nie podważając ludzi, którzy ją tworzą? Jak uczynić te systemy użytecznymi w środowiskach produkcyjnych, gdzie pewność prawna ma takie same znaczenie jak jakość wyjściowa? Te pytania ukształtowały wszystko, co zbudowaliśmy. Założyliśmy Bria na zasadzie, że innowacja i odpowiedzialność nie są siłami przeciwnymi — muszą postępować razem, lub technologia zawiedzie wszystkich.

Twój akademicki background w dziedzinie widzenia komputerowego i Twoje 50+ patentów łączą badania i realną innowację. Jak doświadczenie to wpłynęło na techniczny plan i długoterminową strategię Bria?

Moje doświadczenie badawcze nauczyło mnie myślenia w systemach — jak różne warstwy zrozumienia łączą się, aby utworzyć znaczenie. Wiele moich patentów koncentruje się na tym, jak maszyny interpretują strukturę informacji wizualnej, i ten sposób myślenia naturalnie przekształcił się w podejście Bria. Spójrzmy na generowanie obrazów jako proces kompozycyjny, a nie losowy.

Ale patenty nie dotyczą tylko technologii — dotyczą łączenia technologii z rzeczywistością biznesową. Znaczna część naszego portfela IP dotyczy warstwy systemów: jak stworzyć ramy atrybucji, które łączą wygenerowane treści z ich źródłami szkoleniowymi? Jak zbudować modele ekonomiczne, które wynagradzają twórców w skali? To nie są czysto techniczne problemy — są to pytania o infrastrukturę, modele biznesowe i projektowanie rynku.

To szersze spojrzenie ukształtowało naszą długoterminową strategię. Innowacja nie dotyczy tylko posuwania naprzód podstawowych modeli. Dotyczy tworzenia nowych struktur ekonomicznych, nowych ram umownych, nowych sposobów, w jaki branża może działać w sposób zrównoważony. Celem nie jest tylko produkowanie lepszych wyników — jest to zrozumienie, jak te wyniki są tworzone, kto do nich przyczynił się i jak wartość przepływa przez system. To miejsce, w którym spotyka się nauka, myślenie o produkcie i architektura biznesowa.

Bria właśnie ogłosiła FIBO, opisaną jako pierwszy deterministyczny model podstawowy wizualny dla profesjonalnej generatywnej sztucznej inteligencji. Co sprawia, że FIBO jest fundamentalnie różna od istniejących systemów sztucznej inteligencji wizualnej?

Nazwa sama sygnalizuje nasze podejście: FIBO to skrót od Fibonacci, ciągu matematycznego słynącego ze swoich wewnętrznych właściwości estetycznych. Złota proporcja — stosunek między kolejnymi liczbami w ciągu Fibonacci — pojawia się w tym, co postrzegamy jako proporcje wizualnie przyjemne, od matematyki, sztuki wizualnej, geometrii i architektury. Widzimy ją w wymiarach rzymskiego Panteonu i Białego Domu, w ludzkim ciele i twarzy, jak ilustruje to Vitruvian Man Leonarda da Vinci, i na całym obszarze form naturalnych. To połączenie struktury matematycznej i piękna wizualnego jest dokładnie tym, co FIBO uosabia: jakość estetyczna poprzez strukturę formalną.

FIBO zmienia relację między intencją a wyjściem. Większość systemów sztucznej inteligencji wizualnej wstawia warstwy interpretacji między tym, co chcesz, a tym, co otrzymujesz — piszesz podpowiedź, model tłumaczy ją przez kodery językowe, rozpraszając ją przez szum, i masz nadzieję, że wynik odpowiada Twojej wizji. FIBO usuwa te warstwy całkowicie.

Zrobiliśmy sztuczną inteligencję wizualną, która działa jak kod — każdy element kreatywny staje się edytowalny i powtarzalny. To przełom dla profesjonalistów, którzy byli zablokowani przez ruletkę podpowiedzi. Oznacza to, że każdy element, kierunek oświetlenia, kąt kamery, paleta kolorów, kompozycja, styl istnieje jako jawna, kontrolowalna właściwość. Struktura JSON pozwala na modyfikację tylko parametrów, które chcesz, podczas gdy wszystkie inne pozostają zablokowane. Możesz dostosować natężenie oświetlenia bez wpływu na kompozycję lub przesunąć kąt kamery bez zmiany palety kolorów. System robi dokładnie to, co określasz, każdego razu.

Organizujemy hackathony z Fal i NVIDIA (NVDA ), aby pokazać deweloperom, jak deterministyczna generacja działa w praktyce. Sama struktura JSON otwiera czarne pudełko — możesz zobaczyć dokładnie, które parametry stworzyły obraz, odtworzyć go i zmodyfikować z precyzją. To zupełnie inny paradygmat niż inżynieria podpowiedzi.

Tradycyjne systemy tekst-do-obrazu opierają się na coraz bardziej skomplikowanych podpowiedziach, aby osiągnąć określone wyniki. Jak podejście FIBO rozwiązuje problem złożoności podpowiedzi?

Dwa problemy muszą być rozwiązane. Po pierwsze, problemy losowości podpowiedzi istnieją, ponieważ obecne modele próbują wydobyć intencję użytkownika i dodać to, co model „myśli”, jest estetyczne lub pożądane za pomocą podpowiedzi. Po drugie, brak kontroli nad właściwościami profesjonalnymi

FIBO odwraca to. Model został przeszkolony na ponad 1000-słownych opisach wizualnych na obraz, które jawnie zakodowały ponad 100 niezależnych atrybutów w formacie JSON. To nie było przetworzone lub wydobyte — było rodzimym formatem szkoleniowym. Ponieważ każdy atrybut jest reprezentowany strukturalnie od samego początku, model nauczył się kompozycji wizualnej jako zestawu dyskretnych, kontrolowalnych parametrów, a nie jako mglistej interpretacji tekstu.

To, co to oznacza w praktyce: definiujesz intencję estetyczną przez strukturę, a nie przez „podpowiedź i modlitwę”. Poziom dopasowania tekstu do obrazu jest fundamentalnie wyższy, ponieważ nie ma warstwy tłumaczenia. Mówisz w rodzimym języku modelu. A ponieważ właściwości są niezależne, możesz iterować nad oświetleniem bez nieumyślnego zmieniania kompozycji lub dostosowywać paletę kolorów bez wpływu na styl. Kontrola jest chirurgiczna.

FIBO wprowadza „refine” workflow, który różni się od typowej iteracyjnej generacji. Jak to zmienia podejście profesjonalistów do produkcji wizualnej?

Większość generatywnych workflow jest iteracyjna w frustrujący sposób — generujesz, oceniasz, dostosowujesz swoją podpowiedź, generujesz ponownie, masz nadzieję, że jest bliżej. to „podpowiedź i modlitwa”. Nigdy nie jesteś do końca pewien, co się zmieniło lub dlaczego.

Refine zmienia eksperymentowanie w projektowanie. Nie zgadujesz, co nowa podpowiedź może zrobić — sterujesz obrazem, dokładnie tak, jak dostosowujesz światło lub kolor w Photoshopie. Nie musisz pracować na poziomie JSON bezpośrednio — model języka-wizji modyfikuje JSON dla Ciebie na podstawie instrukcji języka naturalnego. Ale sam JSON pozwala Ci zrozumieć, co się stało. Generujesz początkowy obraz, badasz jego reprezentację JSON, identyfikujesz, które właściwości wymagają dostosowania — może natężenie oświetlenia jest za wysokie, lub kąt kamery musi się przesunąć o 15 stopni — i modyfikujesz tylko te wartości za pomocą prostych instrukcji. Wszystko inne pozostaje zablokowane.

Ta struktura jest idealna dla workflow agentycznych. Agent sztucznej inteligencji może analizować JSON, zrozumieć pełny stan obrazu, wprowadzić celowe modyfikacje i wyjaśnić swoje rozumowanie — wszystko dzięki temu, że parametry są jawne i interpretowalne. Agent nie zgaduje, co zmiana podpowiedzi mogłaby zrobić; robi precyzyjne dostosowania do znanych właściwości.

To usuwa nieprzewidywalność, która utrzymywała profesjonalistów sceptycznych wobec generatywnej sztucznej inteligencji. Kiedy możesz zobaczyć pełny zestaw parametrów, które stworzyły obraz, zrozumieć, co każda właściwość kontroluje, i modyfikować poszczególne atrybuty z pewnością, że nic innego nie ulegnie zmianie, nie eksperymentujesz — projektujesz. Widoczność JSON otwiera czarne pudełko całkowicie. Dla profesjonalnych workflow produkcyjnych, gdzie spójność i kontrola mają większe znaczenie niż nowość, to jest różnica między zabawką kreatywną a narzędziem produkcyjnym.

Etyka danych i bezpieczeństwo marki stały się centralnymi dla przedsiębiorstw sztucznej inteligencji. Jak użycie przez Bria w pełni licencjonowanych, oczyszczonych z praw danych zapewnia zarówno zgodność, jak i szacunek dla własności intelektualnej twórców?

Od samego początku zdecydowaliśmy, że jeśli branża ma rozwijać się w sposób odpowiedzialny, musi zacząć od integralności danych. Każdy obraz, który przeszkolił FIBO, pochodzi z licencjonowanych, oczyszczonych z praw źródeł za pośrednictwem partnerstw z liderami treści, takimi jak Getty Images (GETY ) i Envato. To zapewnia, że nasze modele są zgodne i uczciwe. Widzimy szacunek dla twórców jako część łańcucha wartości, a nie jako ograniczenie. Przedsiębiorstwa korzystają z tej integralności, ponieważ daje im pewność prawną i etyczną, której potrzebują, aby rozwijać się z pewnością.

FIBO została przeszkolona, aby nauczyć się unikalnego stylu marki i tożsamości każdej firmy. Jak ta zdolność zmienia podejście globalnych marek do tworzenia treści i spójności wizualnej?

Marki mają swoje własne DNA wizualne — unikalny sposób wyrażania emocji, zaufania i celu przez projektowanie. FIBO może nauczyć się tego języka. Po przeszkoleniu generuje obrazy, które odzwierciedlają tę samą kompozycję, ton i atmosferę, które definiują tożsamość marki. To zmienia sztuczną inteligencję z asystenta kreatywnego w aktywo marki. Pomaga globalnym zespołom tworzyć zgodność, a nie przybliżenie. Rezultatem jest spójność w skali bez utraty indywidualności.

Z wczesnymi użytkownikami, którzy już używają FIBO do automatyzacji projektowania opakowań, obrazów produktów i kampanii kreatywnych, jakie wyniki lub opinie najbardziej zwróciły Twoją uwagę do tej pory?

Zmiana myślenia. Zespoły zaczynają traktować sztuczną inteligencję jako część swoich narzędzi operacyjnych, a nie jako nowinkę. Jeden globalny brand generuje warianty regionalne opakowań znacznie szybciej, utrzymując spójność marki. Wiodąca agencja kreatywna przyspieszyła rozwój kampanii dziesięciokrotnie dzięki kontrolowanej iteracji. Ale prawdziwy sygnał pochodzi od kierowników kreatywnych, którzy mówią, że czują się bardziej kontrolować; że model rozumie ich intencję wizualną. To punkt zwrotny dla branży.

Bria pozycjonuje się jako lider w etycznej i kontrolowalnej sztucznej inteligencji. Jak widzisz, jak ta filozofia kształtuje przyszłe regulacje lub standardy branżowe dla sztucznej inteligencji wizualnej?

Doszliśmy do punktu, w którym innowacja i zarządzanie muszą iść w parze. Regulacja nie jest przeszkodą, ale raczej infrastrukturą dla zrównoważonego wzrostu. Nasze podejście — przejrzyste dane, deterministyczne wyjścia, jasna pochodzenie — jest ściśle związane z tym, o co proszą nowe polityki. Uważam, że zobaczymy nowe standardy, które priorytetowo traktują śledzenie, wyjaśnialność i ochronę praw. Filozofia Bria polega na tym, aby pomóc określić te standardy poprzez praktykę, a nie oświadczenia polityczne.

Spójrzając w przyszłość, co jest następne dla Bria po FIBO? Czy widzisz rozszerzenie na multimodalną sztuczną inteligencję, która łączy generowanie obrazów, wideo i 3D pod jedną kontrolowaną ramą?

Tak. Te same zasady, które napędzają FIBO — struktura, kontrola, przejrzystość — stosują się we wszystkich dziedzinach wizualnych. Jesteśmy już w trakcie badania rozszerzeń na wideo i 3D, gdzie determinizm może przynieść tę samą niezawodność, której teraz doświadczają przedsiębiorstwa z obrazami. Naszym celem jest uczynienie kreatywności sztucznej inteligencji tak kontrolowaną i bezpieczną, jak pisanie kodu — i rozszerzenie tego na każde medium wizualne, od obrazu do wideo do 3D.

Dziękuję za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić Bria.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.