Andersonin kulma
Älytekstuureiden Tutkimus Envisages Eroon Erillisiin Volume Kontrolliin Dialogiin, Musiikkiin ja Äänitehosteisiin

Uusi tutkimusyhteistyö Mitsubishi johtaa tutkii mahdollisuutta erottaa kolme erillistä soundtrackia alkuperäisestä äänilähteestä, jakaa ääniraidan puheeseen, musiikkiin ja äänitehosteisiin (ts. taustameluun).
Koska tämä on jälkikäteen prosessointirunko, se tarjoaa mahdollisuuksia myöhempien sukupolven monimedialle katselualustoille, mukaan lukien kuluttajalaitteet, tarjota kolmiopohjaiset volume-ohjaimet, jotka sallivat käyttäjän korottaa puheen äänenvoimakkuutta tai laskea soundtrackin äänenvoimakkuutta.
Lyhyessä klipissä alla olevasta videosta tutkimuksen kanssa (katso artikkelin loppu kokonaisesta videosta), näemme eri osia soundtrackista korostettuna, kun käyttäjä vetää ohjainta kolmiopohjaisen käyttöliittymän yli, jossa on kolme äänikomponenttia kussakin kulmassa:
Lyhyt klippi videosta, joka on liitetty tutkimukseen (katso upotus artikkelin lopussa). Kun käyttäjä vetää kohdistinta yhteen kolmesta erotetusta osasta triangelin muotoisessa käyttöliittymässä (oikealla), ääni korostaa kyseistä osaa soundtrackista. Vaikka pidempi video mainitsee useita muita esimerkkejä YouTubessa, nämä näyttävät olevan tällä hetkellä saatavilla. Lähde: https://vimeo.com/634073402
Tutkimusraportti on nimeltään The Cocktail Fork Problem: Three-Stem Audio Separation for Real-World Soundtracks, ja se on peräisin tutkijoilta Mitsubishi Electric Research Laboratories (MERL) -laitoksesta Cambridge, MA, ja Intelligent Systems Engineering -osastolta Indianan yliopistossa Illinoisissa.
Erilliset Osat Soundtrackista
Tutkijat ovat nimeäneet haasteen ‘The Cocktail Party Problem’, koska se vaatii erottamista voimakkaasti sekoittuneista soundtrackin osista, mikä luo tien, joka muistuttaa haarukkaa (katso alla oleva kuva). Käytännössä monikanavaiset (ts. stereofoniset ja enemmän) soundtrackit voivat sisältää erilaisia määriä erilaisia sisältöjä, kuten puhetta, musiikkia ja taustamelua, erityisesti koska puhe taipuu hallitsemaan keskikanavaa Dolby 5.1 -sekoituksissa. Tällä hetkellä kuitenkin äänierottamisen hyvin aktiivinen tutkimuskenttä keskittyy kaappaamaan nämä säikeet yhdestä, paistetusta soundtrackista, kuten tämä tutkimus.

The Cocktail Fork – erottaa kolme erillistä soundtrackia yhdistetystä ja yksittäisestä soundtrackista. Lähde: https://arxiv.org/pdf/2110.09958.pdf
Viimeaikainen tutkimus on keskittynyt puheen erottamiseen erilaisissa ympäristöissä, usein tarkoituksena on puhdas ääni äänidatan käsittelyä varten myöhemmässä vuorovaikutuksessa Luonnollisen Kielen Prosessointijärjestelmien (NLP) kanssa, mutta myös erottamiseen arkistoiduista laulusta äänistä, joko luomaan syntetisiä versioita oikeista (jopa kuolleista) laulajista tai helpottamaan Karaoke-tyyppistä musiikin erottamista.
Tietojoukko Kullekin Osalle
Tähän asti vähän huomiota on kiinnitetty siihen, että tämänkaltaista älytekniikkaa käytetään antamaan käyttäjille enemmän valtaa soundtrackin sekoitukseen. Siksi tutkijat ovat muodollistaneet ongelman ja kehittäneet uuden tietojoukon avuksi jatkuvaan tutkimukseen monityyppisen soundtrackin erottamiseksi sekä testaamaan sitä useilla olemassa olevilla äänierottamisjärjestelmillä.
Uusi tietojoukko, jonka tutkijat ovat kehittäneet, on nimeltään Divide and Remaster (DnR), ja se on johdettu aiemmista tietojoukoista LibriSpeech, Free Music Archive ja Freesound Dataset 50k (FSD50K). Niille, jotka haluavat työskennellä DnR: n kanssa alusta alkaen, tietojoukkoa on rakennettava uudelleen kolmesta lähteestä; muuten se tullaan pian saataville Zenodossa, tutkijat väittävät. Kuitenkin kirjoitushetkellä tarjottu GitHub-linkki tietojoukon hakemisessa ei ole tällä hetkellä aktiivinen, joten kiinnostuneiden on odotettava hetkeä.
Tutkijat ovat havainneet, että Sonyn ehdottama CrossNet un-mix (XUMX) -arkkitehtuuri toimii erityisen hyvin DnR: n kanssa.

Sonyn CrossNet-arkkitehtuuri.
Tutkijat väittävät, että heidän koneoppimismallinsa toimivat hyvin YouTuben soundtrackeilla, vaikka arviot, jotka esitetään tutkimusraportissa, perustuvat synteettisiin tietoihin, ja toimitettu pääasiallinen tuki (upotettu alla) on tällä hetkellä ainoa, joka näyttää olevan saatavilla.
Kolme tietojoukkoa, joita käytetään, käsittää kokoelman siitä, mitä soundtrackista on erotettava: FSD50K on äänitehosteiden parissa, ja siinä on 50 000 44,1 kHz monofonista ääniä, joissa on 200 luokan merkintää Google AudioSet -ontologiasta; Free Music Archive sisältää 100 000 stereomusiikkikappaletta, jotka kattavat 161 musiikkityyliä, vaikka tutkijat ovat käyttäneet alajoukkoa, joka sisältää 25 000 kappaletta, FSD50K: n kanssa samanarvoisuuden vuoksi; ja LibriSpeech tarjoaa DnR: lle 100 tuntia äänikirjanimikkeitä 44,1 kHz mp3-äänitiedostoina.
Tuleva Työ
Tutkijat odottavat jatkuvaa työtä tietojoukon parissa ja yhdistelmän erillisten mallien kehittämistä lisätutkimuksia varten puheentunnistus- ja ääniluokittelukehyksissä, joissa on automaattinen tekstitys puheelle ja ei-puheäänteille. He aikovat myös arvioida mahdollisuuksia sekoittamistekniikoille, joilla voidaan vähentää havaittavia virheitä, mikä on edelleen keskeinen ongelma, kun jaetaan yhdistetty soundtrack sen osiin.
Tämänkaltaista erottamista voisi tulevaisuudessa olla saatavilla kuluttajatuotteena älytelevisioissa, jotka sisältävät erittäin optimoidut inference-verkkorakenteet, vaikka näyttää todennäköiseltä, että varhaiset toteutukset vaatisivat jonkin verran esikäsittelyaikaa ja tallennustilaa. Samsung käyttää jo paikallisia neuroneverkkoja skalaamiseen, kun taas Sonyn Cognitive Processor XR, jota käytetään Bravia-televisioissa, analysoi ja tulkkaa soundtrackeja suorana, kevyen integroidun älyteknologian kautta.
Vaateita soundtrackin sekoituksen paremmasta hallinnasta toistuvat säännöllisesti, ja useimmat ratkaisut, jotka tarjotaan, joutuvat käsittelemään sen, että soundtrack on jo sekoitettu nykyisten standardien (ja oletusten siitä, mitä katsojat haluavat) mukaisesti elokuva- ja televisioalalla.
Yksi katsoja, joka oli ärsyyntynyt soundtrackin eri osien äänenvoimakkuuden hämmästyttävän epätasapuolisuudesta, ryhtyi kehittämään laitteistopohjaisen automaattisen volume-säätimen, joka pystyy samaan äänenvoimakkuutta elokuville ja TV-ohjelmille.
Vaikka älytelevisiot tarjoavat monia keinoja yrittää korottaa puheen äänenvoimakkuutta suurten musiikkivolyymien vastaan, ne kamppailevat sekoitusvaiheessa tehtyjen päätösten ja sisällöntuottajien visioiden kanssa, jotka haluavat yleisön kokea soundtrackinsa sellaisena, kuin ne on asetettu.
Sisällöntuottajat ovat todennäköisesti ärsyyntyneitä tästä mahdollisesta “remix-kulttuurin” lisäyksestä, koska useat alan merkkihenkilöt ovat jo ilmaisseet tyytymättömyytensä oletusarvoisille TV-pohjaisille algoritmeille, kuten liikkeen sileitys.
https://vimeo.com/634073402












