Unghiul lui Anderson
Cercetarea în domeniul inteligenței artificiale prevede controale de volum separate pentru dialog, muzică și efecte sonore

O nouă colaborare de cercetare condusă de Mitsubishi investighează posibilitatea extragerii a trei coloane sonore separate dintr-o sursă audio originală, descompunând coloana sonoră în vorbire, muzică și efecte sonore (adică zgomot ambiental).
Deoarece aceasta este o structură de procesare post-factum, oferă potențial pentru generații viitoare de platforme de vizualizare multimedia, inclusiv echipamente pentru consumatori, pentru a oferi controale de volum cu trei puncte, permițând utilizatorului să ridice volumul dialogului sau să reducă volumul coloanei sonore.
În clipul scurt de mai jos de la videoclipul care însoțește cercetarea (a se vedea sfârșitul articolului pentru videoclipul complet), vedem diferite aspecte ale coloanei sonore accentuate pe măsură ce utilizatorul trage un control pe un triunghi cu fiecare dintre cele trei componente audio într-un colț:
Un clip scurt de la videoclipul care însoțește articolul (a se vedea încorporarea la sfârșitul articolului). Pe măsură ce utilizatorul trage cursorul spre una dintre cele trei componente extrase în interfața triunghiulară (în partea dreaptă), sunetul accentuează acea parte a coloanei sonore tripartite. Deși videoclipul mai lung citează o serie de exemple suplimentare de pe YouTube, acestea par să fie în prezent indisponibile. Sursă: https://vimeo.com/634073402
Articolul științific se intitulează Problema furculiței de cocktail: separarea audio trifazată pentru coloane sonore din lumea reală și provine de la cercetători de la Laboratoarele de cercetare Mitsubishi Electric (MERL) din Cambridge, MA, și de la Departamentul de inginerie a sistemelor inteligente de la Universitatea din Indiana, Illinois.
Separarea aspectelor unei coloane sonore
Cercetătorii au denumit această provocare “Problema petrecerii de cocktail” deoarece implică izolarea elementelor puternic împletite ale unei coloane sonore, ceea ce creează o hartă care semănă cu o furculiță (a se vedea imaginea de mai jos). În practică, coloanele sonore multicanale (adică stereo și mai mult) pot avea cantități diferite de tipuri de conținut, cum ar fi dialog, muzică și ambianță, în special deoarece dialogul are tendința să domine canalul central în mixurile Dolby 5.1. În prezent, cu toate acestea, domeniul de cercetare foarte activ al separării audio se concentrează pe capturarea acestor fire dintr-o coloană sonoră unică și “coaptă”, așa cum face și cercetarea actuală.

Furculița de cocktail – obținerea a trei coloane sonore distincte dintr-o coloană sonoră unită și unică. Sursă: https://arxiv.org/pdf/2110.09958.pdf
Cercetările recente s-au concentrat pe extragerea vorbirii în diferite medii, adesea în scopul denumirii audio pentru vorbire pentru ulterioarele angajamente cu sistemele de procesare a limbajului natural (NLP), dar și pe izolarea vocilor de cântăreț din arhivă, fie pentru a crea versiuni sintetice ale unor cântăreți reali (chiar și morți), fie pentru a facilita izolarea muzicii în stil Karaoke.
Un set de date pentru fiecare aspect
Până în prezent, s-a acordat puțină atenție utilizării acestei tehnologii AI pentru a oferi utilizatorilor un control mai mare asupra amestecului unei coloane sonore. Prin urmare, cercetătorii au formalizat problema și au generat un nou set de date ca ajutor pentru cercetările continue privind separarea coloanelor sonore de tipuri multiple, precum și testarea acestuia pe diverse cadre de separare audio existente.
Noul set de date dezvoltat de autori se numește Divide și remasteriza (DnR) și este derivat din seturile de date anterioare LibriSpeech, Free Music Archive și Freesound Dataset 50k (FSD50K). Pentru cei care doresc să lucreze cu DnR de la zero, setul de date trebuie reconstruit din cele trei surse; în caz contrar, va fi disponibil în curând pe Zenodo, susțin autorii. Cu toate acestea, la momentul scrierii, legătura GitHub pentru utilitățile de extragere a surselor nu este în prezent activă, astfel încât cei interesați pot trebui să aștepte o perioadă.
Cercetătorii au constatat că arhitectura CrossNet un-mix (XUMX) propusă de Sony în luna mai funcționează deosebit de bine cu DnR.

Arhitectura audio CrossNet a Sony.
Autorii afirmă că modelele lor de extragere prin învățare automată funcționează bine pe coloane sonore de pe YouTube, deși evaluările prezentate în articol se bazează pe date sintetice, iar videoclipul principal care susține (încorporat mai jos) este în prezent singurul care pare să fie disponibil.
Cele trei seturi de date utilizate cuprind fiecare o colecție de tipul de ieșire care trebuie separată dintr-o coloană sonoră: FSD50K este ocupat cu efecte sonore și conține 50.000 de clipuri audio mono de 44,1 kHz etichetate cu 200 de etichete de clasă din ontologia AudioSet a Google; Free Music Archive prezintă 100.000 de cântece stereo care acoperă 161 de genuri muzicale, deși autorii au utilizat un subset care conține 25.000 de cântece, pentru paritate cu FSD50K; și LibriSpeech oferă DnR 100 de ore de mostre de carte audio ca fișiere audio mp3 de 44,1 kHz.
Lucrări viitoare
Autorii anticipează lucrări viitoare asupra setului de date și o combinație a modelelor separate dezvoltate pentru cercetări suplimentare privind cadrele de recunoaștere a vorbirii și clasificarea sunetelor, cu generare automată de subtitrări pentru vorbire și sunete non-vorbire. De asemenea, intenționează să evalueze posibilitățile abordărilor de remixare care pot reduce artefactele perceptive, care rămân problema centrală atunci când se divide o coloană sonoră audio unită în componentele sale constitutive.
Această separare ar putea fi disponibilă în viitor ca o marfă pentru consumatori în televizoare inteligente care incorporează rețele de inferență foarte optimizate, deși pare probabil că implementările inițiale ar necesita un anumit nivel de timp de preprocesare și spațiu de stocare. Samsung folosește deja rețele neurale locale pentru escaladare, în timp ce procesorul cognitiv XR al Sony, utilizat în gama Bravia, analizează și reinterpretă coloane sonore în timp real prin intermediul inteligenței artificiale integrate ușoare.
Apele pentru un control mai mare asupra amestecului unei coloane sonore recură periodic, și majoritatea soluțiilor oferite trebuie să aibă în vedere faptul că coloana sonoră a fost deja redusă în conformitate cu standardele actuale (și presupunerile despre ceea ce doresc spectatorii) în industriile cinematografică și de televiziune.
Un spectator, iritat de disparitatea șocantă a nivelurilor de volum între diverse elemente ale coloanelor sonore de film, a devenit atât de disperat încât a dezvoltat un ajustor automat de volum bazat pe hardware, capabil să egalizeze volumul pentru filme și programe de televiziune.
Deși televizoarele inteligente oferă o varietate de metode pentru a încerca să amplifice volumul dialogului împotriva nivelurilor de volum grandioase pentru muzică, ele luptă împotriva deciziilor luate la momentul mixării și, în mod evident, a viziunilor producătorilor de conținut care doresc ca publicul să experimenteze coloanele sonore exact așa cum au fost configurate.
Producătorii de conținut par să se opună probabil acestei posibile adăugări la “cultura remixului”, deoarece mai mulți luminari ai industriei și-au exprimat deja nemulțumirea împotriva algoritmilor de post-procesare TV bazate pe netezirea mișcării pe baza setărilor implicite.
https://vimeo.com/634073402












