Andersons vinkel

AI-forskning ser muligheder for separate volumenkontroller for dialog, musik og lydeffekter

mm
Føj Unite.AI til dine foretrukne kilder på Google

En ny forskningssamarbejde ledet af Mitsubishi undersøger muligheden for at udtrække tre separate lydspor fra en oprindelig lydkilde, hvor lydsporet deles op i tale, musik og lydeffekter (dvs. baggrundsstøj).

Da dette er et post-facto procesramme, tilbyder det potentiale for senere generationer af multimedievisningsplatforme, herunder forbrugerudstyr, at tilbyde trepunkts-volumenkontrol, der giver brugeren mulighed for at øge volumen på dialog eller sænke volumen på en lydspor.

I den korte klip nedenfor fra den tilhørende video for forskningen (se slutningen af artiklen for fuld video), ser vi forskellige aspekter af lydsporet, der fremhæves, mens brugeren trækker en kontrol over en trekant med hver af de tre lydkomponenter i en hjørne:

En kort klip fra videoen, der følger med papiret (se indlejret i slutningen af artiklen). Da brugeren trækker markøren mod en af de tre udtrukne aspekter i trekantsgrænsefladen (til højre), fremhæves den del af den tredelte lydspor. Selvom den længere video nævner flere eksempler på YouTube, synes disse for øjeblikket at være utilgængelige. Kilde: https://vimeo.com/634073402

Papiret hedder The Cocktail Fork Problem: Three-Stem Audio Separation for Real-World Soundtracks og kommer fra forskere ved Mitsubishi Electric Research Laboratories (MERL) i Cambridge, MA, og afdelingen for intelligente systemer på Indiana University i Illinois.

At skille aspekter af en lydspor

Forskerne har kaldt udfordringen ‘The Cocktail Party Problem’, fordi den indebærer at isolere stærkt sammenflettede elementer af en lydspor, hvilket skaber en vejviser, der ligner en gaffel (se billedet nedenfor). I praksis kan multikanalslydspor (dvs. stereo og mere) have forskellige mængder af typer af indhold, såsom dialog, musik og baggrundsstøj, særligt da dialog tenderer til at dominere centerkanalen i Dolby 5.1-miks. For tiden er det meget aktive forskningsfelt for lydseparation koncentreret om at fange disse tråde fra en enkelt, bagt lydspor, som den nuværende forskning også gør.

The Cocktail Fork – at udlede tre distinkte lydspor fra en sammenflettede og enkelt lydspor. Kilde: https://arxiv.org/pdf/2110.09958.pdf

The Cocktail Fork – at udlede tre distinkte lydspor fra en sammenflettede og enkelt lydspor. Kilde: https://arxiv.org/pdf/2110.09958.pdf

Seneste forskning har koncentreret sig om at udtrække tale i forskellige miljøer, ofte til formål at rense talelyd for efterfølgende engagement med Natural Language Processing (NLP)-systemer, men også på isolation af arkivsangstemmer, enten for at skabe syntetiske versioner af virkelige (selv døde) sangere eller for at facilitere Karaoke-stil musikisolation.

En dataset for hver aspekt

Indtil nu er der ikke blevet givet megen overvejelse til at bruge denne type AI-teknologi til at give brugerne mere kontrol over lydsporens mix. Derfor har forskerne formaliseret problemet og genereret en ny dataset som en hjælp til fortsat forskning i multi-type lydseparation, samt testet det på forskellige eksisterende lydseparationsrammer.

Den nye dataset, som forfatterne har udviklet, kaldes Divide and Remaster (DnR), og er afledt fra tidligere datasets LibriSpeech, Free Music Archive og Freesound Dataset 50k (FSD50K). For dem, der ønsker at arbejde med DnR fra scratch, skal datasettet genopbygges fra de tre kilder; ellers vil det snart være tilgængeligt på Zenodo, som forfatterne hævder. Imidlertid er den tilgængelige GitHub-link for kildeudtrækningsværktøjer ikke aktuel på nuværende tidspunkt, så de interesserede må måske vente lidt.

Forskerne har fundet, at CrossNet un-mix (XUMX)-arkitekturen, som Sony foreslog i maj, fungerer særligt godt med DnR.

Sonys CrossNet-arkitektur.

Sonys CrossNet-arkitektur.

Forfatterne hævder, at deres maskinelæringsekstraktionsmodeller fungerer godt på lydspor fra YouTube, selvom evalueringerne, der præsenteres i papiret, er baseret på syntetisk data, og den leverede hovedvideo (indlejret nedenfor) er på nuværende tidspunkt den eneste, der synes at være tilgængelig.

De tre datasets, der hver især består af en samling af den type output, der skal udtrækkes fra en lydspor, består af: FSD50K, der er optaget af lydeffekter og indeholder 50.000 44,1 kHz mono-lydklip markeret med 200 klasselabel fra Googles AudioSet-ontologi; Free Music Archive, der indeholder 100.000 stereo-sange, der dækker 161 musikgenrer, selvom forfatterne har brugt en undermængde, der indeholder 25.000 sange, for lighed med FSD50K; og LibriSpeech, der giver DnR 100 timers audio-bogprøver som 44,1 kHz mp3-lydfiler.

Fremtidig arbejde

Forfatterne forventer yderligere arbejde på datasettet og en kombination af de separate modeller, der er udviklet til yderligere forskning i talegenkendelse og lydklassifikationsrammer, der omfatter automatisk undertekstgenerering for tale og ikke-tale-lyde. De har også intentioner om at evaluere muligheder for remix-tilgange, der kan reducere perceptuelle artefakter, hvilket er det centrale problem, når man deler en sammenflettede lydspor op i dets bestanddele.

Denne type separation kunne i fremtiden være tilgængelig som en forbruger-vare i smarte tv’er, der integrerer højt optimerede inferensnetværk, selvom det synes sandsynligt, at tidlige implementeringer ville kræve nogen form for forarbejdnings tid og lagerplads. Samsung bruger allerede lokale neurale netværk til opskalering, mens Sonys Cognitive Processor XR, der bruges i virksomhedens Bravia-række, analyserer og genfortolker lydspor på en live-basis via letvægts-integreret AI.

Opfordringer til større kontrol over lydsporens mix gentager sig periodisk, og de fleste løsninger, der tilbydes, må have at gøre med, at lydsporet allerede er bounset ned i overensstemmelse med nuværende standarder (og antagelser om, hvad seerne ønsker) i film- og tv-industrien.

En seer, der var irriteret over den chokerende ulighed i volumenniveauer mellem forskellige elementer af filmlydspor, blev desperat nok til at udvikle en hardware-baseret automatisk volumjusteringscirkuit, der kan equalisere volumen for film og tv.

Selvom smarte tv’er tilbyder en varieret række af metoder til at forsøge at forstærke dialogvolumen mod store volumenniveauer for musik, kæmper de alle imod de beslutninger, der er truffet på mix-tidspunktet, og, kan man argumentere for, de visioner, som indholdsskabere ønsker, at publikum skal opleve deres lydspor nøjagtig, som de blev sat op.

Indholdsskabere synes sandsynligt at modsætte sig denne potentielle tilføjelse til ‘remix-kultur’, da flere branchens kendisser allerede har udtrykt utilfredshed med standard post-processing-tv-baserede algoritmer såsom motion-smoothing.

https://vimeo.com/634073402

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai