Interviuri

Ofir Krakowski, CEO și Co-Fondator al Deepdub – Seria de Interviuri

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Ofir Krakowski este co-fondator și CEO al Deepdub. Cu 30 de ani de experiență în informatică și învățare automată, el a jucat un rol cheie în fondarea și conducerea departamentului de învățare automată și inovare al Forțelor Aeriene Israeliene timp de 25 de ani.

Deepdub este o companie de dublaj condusă de inteligență artificială care utilizează învățarea profundă și clonarea vocii pentru a oferi localizare de înaltă calitate și scalabilă pentru filme, televiziune și conținut digital. Fondată în 2019, permite creatorilor de conținut să păstreze performanțele originale, în timp ce traduc dialogul în multiple limbi în mod transparent. Prin integrarea sintezei vocale bazate pe inteligență artificială cu supravegherea lingvistică umană, Deepdub îmbunătățește accesibilitatea conținutului la nivel global, reducând timpul și costurile metodelor tradiționale de dublaj. Compania a obținut recunoaștere în industrie pentru inovația sa, asigurând parteneriate majore, certificări și finanțare pentru a-și extinde tehnologia de localizare bazată pe inteligență artificială în sectorul divertismentului.

Ce v-a inspirat să fondați Deepdub în 2019? A existat un moment sau o provocare particulară care a condus la crearea sa?

Dublajul tradițional a fost mult timp standardul industriei pentru localizarea conținutului, dar este un proces scump, consumator de timp și intensiv din punct de vedere al resurselor. În timp ce soluțiile de voce generate de inteligență artificială existau, lipseau de profunzimea emoțională necesară pentru a captura cu adevărat performanța unui actor, făcându-le nepotrivite pentru conținut de înaltă calitate și complex.

Am identificat o oportunitate de a combina această lacună prin dezvoltarea unei soluții de localizare bazate pe inteligență artificială care menține autenticitatea emoțională a performanței originale, îmbunătățind în același timp eficiența. Am dezvoltat tehnologia noastră proprietară eTTS™ (Emoție-Text-la-Vorbire), care asigură că vocile generate de inteligență artificială au aceeași greutate emoțională, ton și nuanță ca și actorii umani.

Ne imaginăm o lume în care barierele lingvistice și culturale nu mai sunt obstacole pentru accesibilitatea conținutului la nivel global. La crearea platformei noastre, am recunoscut provocarea limitărilor lingvistice din divertisment, învățământ la distanță, FAST și alte industrii, și ne-am propus să revoluționăm localizarea conținutului.

Pentru a asigura că soluția Deepdub oferă localizare și dublaj de cea mai înaltă calitate pentru conținut complex la scară, am decis să adoptăm o abordare hibridă și să integrăm experți lingvistici și vocali în proces, alături de tehnologia noastră eTTS™.

Viziunea noastră este de a democratiza producția de voce, făcând-o masiv scalabilă, universal accesibilă, incluzivă și relevantă din punct de vedere cultural.

Care au fost cele mai mari provocări tehnice și de afaceri cu care v-ați confruntat la lansarea Deepdub, și cum le-ați depășit?

Câștigarea încrederii industriei divertismentului a fost o barieră majoră la lansarea Deepdub. Hollywoodul s-a bazat pe dublajul tradițional timp de decenii, și trecerea către soluții conduse de inteligență artificială a necesitat demonstrarea capacității noastre de a oferi rezultate de studio de înaltă calitate într-o industrie adesea sceptică față de inteligență artificială.

Pentru a aborda acest scepticism, am îmbunătățit autenticitatea vocilor noastre generate de inteligență artificială prin crearea unei bănci de voce complet licențiate. Această bancă incorporează mostre reale de voce umană, îmbunătățind semnificativ naturalitatea și expresivitatea ieșirilor noastre, ceea ce este crucial pentru acceptarea în Hollywood.

Apoi, am dezvoltat tehnologii proprietare, cum ar fi eTTS™, împreună cu caracteristici precum Controlul Accentei. Aceste tehnologii asigură că vocile generate de inteligență artificială nu numai că captează profunzimea emoțională și nuanțele, dar se și conformează autenticității regionale necesare pentru dublaj de înaltă calitate.

De asemenea, am construit o echipă de post-producție dedicată care lucrează îndeaproape cu tehnologia noastră. Această echipă ajustează fin ieșirile inteligenței artificiale, asigurându-se că fiecare piesă de conținut este lustruită și îndeplinește standardele ridicate ale industriei.

În plus, am extins abordarea noastră pentru a include o rețea globală de experți umani – actori vocali, lingviști și regizori din întreaga lume. Acești profesioniști aduc insight-uri culturale și expertiză creativă inestimabile, îmbunătățind acuratețea culturală și rezonanța emoțională a conținutului nostru dublat.

Echipa noastră de lingvistică lucrează în tandem cu tehnologia și experții noștri globali pentru a asigura că limba utilizată este perfectă pentru contextul cultural al audienței țintă, asigurând astfel autenticitatea și conformitatea cu normele locale.

Prin aceste strategii, combinând tehnologia avansată cu o echipă robustă de experți globali și o echipă de post-producție internă, Deepdub a demonstrat cu succes Hollywoodului și altor companii de producție de top din întreaga lume că inteligența artificială poate îmbunătăți semnificativ fluxurile de lucru tradiționale de dublaj. Această integrare nu numai că optimizează producția, dar oferă și posibilități extinse de expansiune pe piață.

Cum se diferențiază tehnologia de dublaj bazată pe inteligență artificială a Deepdub de metodele tradiționale de dublaj?

Dublajul tradițional este o activitate care necesită multă muncă și poate dura luni pentru un proiect, deoarece necesită actori vocali, ingineri de sunet și echipe de post-producție pentru a recrea manual dialogul în diferite limbi. Soluția noastră revoluționează acest proces prin oferirea unei soluții hibride de la capăt la capăt – combinând tehnologia și expertiza umană – integrată direct în fluxurile de lucru de post-producție, reducând astfel costurile de localizare cu până la 70% și timpul de livrare cu până la 50%.

În contrast cu alte soluții de voce generate de inteligență artificială, tehnologia noastră proprietară eTTS™ permite un nivel de profunzime emoțională, autenticitate culturală și consistență a vocii pe care metodele tradiționale le-au dificultăți în a le atinge la scară.

Ne puteți descrie abordarea hibridă utilizată de Deepdub – cum lucrează inteligența artificială și expertiza umană împreună în procesul de dublaj?

Modelul hibrid al Deepdub combină precizia și scalabilitatea inteligenței artificiale cu creativitatea și sensibilitatea culturală a expertizei umane. Abordarea noastră amestecă arta dublajului tradițional cu tehnologia avansată de inteligență artificială, asigurându-se că conținutul localizat păstrează autenticitatea emoțională și impactul originalului.

Soluția noastră utilizează inteligența artificială pentru a automatiza aspectele de bază ale localizării, în timp ce profesioniștii umani rafinează nuanțele emoționale, accentele și detaliile culturale. Incorporăm atât tehnologia noastră eTTs™, cât și tehnologia noastră Voice-to-Voice (V2V) pentru a îmbunătăți expresivitatea naturală a vocilor generate de inteligență artificială, asigurându-ne că acestea captează profunzimea și realismul performanțelor umane. Astfel, ne asigurăm că fiecare piesă de conținut pare la fel de autentică și de impactantă în forma sa localizată ca și în original.

Lingviștii și profesioniștii vocali joacă un rol cheie în acest proces, deoarece îmbunătățesc acuratețea culturală a conținutului generat de inteligență artificială. Pe măsură ce globalizarea continuă să modeleze viitorul divertismentului, integrarea inteligenței artificiale cu arta umană va deveni standardul de aur pentru localizarea conținutului.

În plus, programul nostru de royalty pentru artiști vocali compensă actorii vocali profesioniști de fiecare dată când vocile lor sunt utilizate în dublajul asistat de inteligență artificială, asigurându-se utilizarea etică a tehnologiei vocale bazate pe inteligență artificială.

Cum îmbunătățește tehnologia eTTS™ (Emoție-Text-la-Vorbire) a Deepdub autenticitatea vocii și profunzimea emoțională în conținutul dublat?

Vocile generate de inteligență artificială tradiționale adesea lipsesc de nuanțele emoționale subtile care fac ca performanțele să fie convingătoare. Pentru a aborda această lipsă, Deepdub a dezvoltat tehnologia sa proprietară eTTS™, utilizând inteligență artificială și modele de învățare profundă pentru a genera vorbire care nu numai că păstrează profunzimea emoțională completă a performanței actorului original, dar integrează și inteligența emoțională umană în procesul automatizat. Această capacitate avansată permite inteligenței artificiale să ajusteze fin vocile sintetizate pentru a reflecta emoțiile intenționate, cum ar fi bucurie, furie sau tristețe, rezonând astfel în mod autentic cu audiența. În plus, eTTS™ excelează în producerea de replici vocale de înaltă fidelitate, imitând nuanțele naturale din vorbirea umană, cum ar fi tonul, ritmul și viteza, esențiale pentru livrarea unor replici care sunt autentice și angajante. Tehnologia îmbunătățește, de asemenea, sensibilitatea culturală, adaptând cu îndemânare ieșirile pentru a controla accentele, aliniind astfel conținutul dublat cu nuanțele culturale și sporindu-i astfel atracția și eficacitatea la nivel global.

Una dintre criticile comune aduse vocilor generate de inteligență artificială este că pot suna robotic. Cum asigură Deepdub că vocile generate de inteligență artificială păstrează naturalitatea și nuanța emoțională?

Tehnologia noastră proprietară utilizează algoritmi de învățare profundă și de învățare automată pentru a oferi soluții de dublaj de înaltă calitate și scalabile, care păstrează intenția originală, stilul, umorul și nuanțele culturale.

Împreună cu tehnologia noastră eTTS™, suita noastră inovatoare include caracteristici precum Voice-to-Voice (V2V), Clonarea Vocii, Controlul Accentei și Banca noastră de Emoție Vocală, care permit echipelor de producție să ajusteze fin performanțele pentru a se potrivi viziunii lor creative. Aceste caracteristici asigură că fiecare voce are profunzimea emoțională și nuanța necesare pentru a spune povești convingătoare și a oferi experiențe de utilizator impactante.

În ultimii ani, am văzut o creștere a succesului soluțiilor noastre în industria Media & Entertainment, așa că am decis recent să deschidem accesul la vocile noastre validate de Hollywood pentru dezvoltatori, întreprinderi și creatori de conținut prin intermediul nostru API Audio. Bazat pe tehnologia noastră eTTS™, API-ul permite generarea de voce în timp real cu parametri avansați de personalizare, inclusiv accent, ton emoțional, viteză și stil vocal.

Caracteristica principală a API-ului nostru este reprezentată de setările predefinite audio, proiectate pe baza a ani de experiență în industrie cu cele mai solicitate nevoi de voce. Aceste setări preconfigurate permit utilizatorilor să adapteze rapid diferite tipuri de conținut fără a necesita o configurare manuală extinsă sau explorare. Setările disponibile includ descrieri audio și cărți audio, nararea documentarelor sau a emisiunilor de realitate, dramă și divertisment, livrarea de știri, comentarii sportive, vocile pentru desene animate sau benzi desenate, Răspunsul Interactiv Vocal (IVR), precum și conținutul promoțional și comercial.

Dublajul cu inteligență artificială implică adaptare culturală și lingvistică – cum asigură Deepdub că soluțiile sale de dublaj sunt adecvate cultural și precise?

Localizarea nu se referă doar la traducerea cuvintelor – este vorba despre traducerea înțelesului, intenției și contextului cultural. Abordarea hibridă a Deepdub combină automatizarea condusă de inteligență artificială cu expertiza lingvistică umană, asigurându-se că dialogul tradus reflectă nuanțele emoționale și culturale ale audienței țintă. Rețeaua noastră de experți în localizare lucrează alături de inteligența artificială pentru a asigura că conținutul dublat se aliniază cu dialectele regionale, expresiile și sensibilitățile culturale.

Care sunt cele mai interesante inovații pe care le lucrați în prezent pentru a duce dublajul cu inteligență artificială la următorul nivel?

Una dintre cele mai mari inovații pe care le dezvoltăm în prezent este Dublajul în Direct/Transmisie, care va permite dublajul în timp real pentru transmisiuni live, cum ar fi evenimente sportive și știri, făcând evenimentele globale instant accesibile. Prin combinarea acestuia cu o altă inovație interesantă, caracteristica noastră eTTs™, o tehnologie proprietară care permite crearea de voci care sună uman la scară largă și cu suport emoțional complet și drepturi comerciale integrate, vom putea oferi dublaj de înaltă calitate, autentic și emoțional, în timp real, fără precedent pe piață.

Luăm, de exemplu, ceremoniile de deschidere ale Jocurilor Olimpice sau orice eveniment sportiv live. În timp ce broadcasterii locali furnizează de obicei comentarii în limba și dialectul regional, această tehnologie va permite spectatorilor din întreaga lume să experimenteze evenimentul în limba lor maternă pe măsură ce se desfășoară.

Dublajul live va redefini modul în care evenimentele live sunt experimentate la nivel global, asigurând că limba nu va mai fi o barieră.

Dublajul generat de inteligență artificială a fost criticat în anumite proiecte recente. Care considerați că sunt factorii cheie care conduc la aceste critici?

Principalele critici provin din preocupări legate de autenticitate, etică și calitate. Unele voci generate de inteligență artificială au lipsit de rezonanță emoțională și nuanță necesare pentru a captura cu adevărat o performanță actoricească, făcându-le nepotrivite pentru conținut complex și de înaltă calitate. La Deepdub, am abordat această problemă prin dezvoltarea de voci generate de inteligență artificială care păstrează emoția și autenticitatea performanței originale. Deepdub a obținut peste 70% satisfacție excepțională a vizualizatorilor în toate dimensiunile, inclusiv distribuție superbă, dialog clar, sincronizare fără cusur și ritm perfect.

O altă problemă este utilizarea etică a vocilor generate de inteligență artificială. Deepdub este un lider în dublajul responsabil cu inteligență artificială, pionier în industrie cu primul program de royalty care compensă actorii vocali pentru performanțele generate de inteligență artificială. Credem că inteligența artificială ar trebui să îmbunătățească creativitatea umană, nu să o înlocuiască, și acest angajament este reflectat în tot ceea ce construim.

Cum vedeți dublajul cu inteligență artificială schimbând industria divertismentului global în următorii 5-10 ani?

În următorul deceniu, dublajul cu inteligență artificială va democratiza conținutul ca niciodată până acum, făcând filme, emisiuni de televiziune și transmisiuni live accesibile tuturor audiențelor, oriunde, în limba lor maternă, instantaneu.

Ne imaginăm o lume în care platformele de streaming și broadcasterii integrează dublaj multilingv în timp real, eliminând barierele lingvistice și permițând poveștilor să călătorească mai departe și mai rapid decât metodele tradiționale de localizare au permis vreodată.

Dincolo de accesibilitatea lingvistică, dublajul cu inteligență artificială poate îmbunătăți, de asemenea, accesul la media pentru persoanele cu deficiențe de vedere. Mulți se bazează pe descrieri audio pentru a urmări conținutul vizual, și dublajul cu inteligență artificială le permite să se implice în conținut străin atunci când subtitrarea nu este o opțiune accesibilă. Prin ruperea atât a barierelor lingvistice, cât și a celor senzoriale, dublajul cu inteligență artificială va ajuta la crearea unei experiențe de divertisment mai incluzivă pentru toată lumea, ceea ce este deosebit de critic în contextul noilor reglementări privind accesibilitatea media care intră în vigoare în întreaga lume.

Care sunt cele mai mari provocări care trebuie încă rezolvate pentru ca dublajul cu inteligență artificială să devină cu adevărat mainstream?

Principalele provocări sunt menținerea unei calități ultra-înalte la scară, asigurarea preciziei culturale și lingvistice și stabilirea unor ghiduri etice pentru vocile generate de inteligență artificială. Cu toate acestea, dincolo de provocările tehnice, acceptarea publică a dublajului cu inteligență artificială depinde de încredere. Spectatorii trebuie să simtă că vocile generate de inteligență artificială păstrează autenticitatea și profunzimea emoțională a performanțelor, mai degrabă decât a suna sintetic sau detașat.

Pentru ca dublajul cu inteligență artificială să fie pe deplin acceptat, el trebuie să fie de înaltă calitate, combinând arta umană și tehnologia la scară și, de asemenea, să demonstreze respect pentru integritatea creativă, nuanța lingvistică și contextul cultural. Acest lucru înseamnă a se asigura că vocile rămân fideli intenției actorilor originali, evitând inexactitățile care ar putea aliena audiența și abordând preocupările etice legate de riscurile de deepfake și proprietatea vocii.

Pe măsură ce dublajul cu inteligență artificială devine mai răspândit, furnizorii de tehnologie trebuie să implementeze standarde riguroase pentru autenticitatea vocii, securitate și protecția proprietății intelectuale. Deepdub conduce această schimbare, asigurându-se că tehnologia vocii bazate pe inteligență artificială îmbunătățește povestirea globală, respectând în același timp contribuțiile artistice și profesionale ale talentului uman. Abia atunci audiența, creatorii de conținut și stakeholderii din industrie vor accepta pe deplin dublajul cu inteligență artificială ca un instrument de încredere și valoros.

Mulțumim pentru acest interviu minunat; cititorii care doresc să afle mai multe despre Deepdub pot vizita Deepdub.

Antoine este un lider vizionar și partener fondator al Unite.AI, condus de o pasiune neclintită pentru modelarea și promovarea viitorului inteligenței artificiale și roboticii. Un întreprinzător serial, el crede că inteligența artificială va fi la fel de disruptivă pentru societate ca și electricitatea și este adesea prins vorbind entuziast despre potențialul tehnologiilor disruptive și AGI.

Ca futurist, el este dedicat explorării modului în care aceste inovații vor modela lumea noastră. În plus, el este fondatorul Securities.io, o platformă axată pe investiții în tehnologii de ultimă generație care redefinesc viitorul și reshapă întregi sectoare.