Andersons vinkel

Syntetiska data: Förändring av ras i ansiktsbilder för att åtgärda bias i medicinska dataset

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Forskare vid UCLA har utvecklat en metod för att förändra den uppenbara rasen på ansikten i dataset som används för att träna medicinska maskinlärningssystem, i ett försök att åtgärda den rasrelaterade bias som många vanliga dataset lider av.

Den nya tekniken kan producera fotorealistiska och fysiologiskt korrekta syntetiska videor med en genomsnittlig hastighet av 0,005 sekunder per bildruta, och förväntas bidra till utvecklingen av nya diagnostiska system för fjärrhälsovård och övervakning – ett område som har expanderat kraftigt under COVID-restriktioner. Systemet är avsett att förbättra tillämpbarheten av fjärr-fotoplethysmografi (rPPG), en datorseende-teknik som utvärderar ansiktsvideoinnehåll för att upptäcka volymförändringar i blodtillförseln på ett icke-invasivt sätt.

Källa: https://arxiv.org/pdf/2106.06007.pdf

Källa: https://arxiv.org/pdf/2106.06007.pdf. Klicka för att förstora.

Arbetet, som använder konvolutionsneurala nätverk (CNN), inkorporerar tidigare forskningskod publicerad av Durham University i Storbritannien 2020, men den nya tillämpningen är avsedd att bevara pulserande signaler i de ursprungliga testdata, snarare än att bara förändra den uppenbara rasen på data, som 2020 års forskning gör.

CNN för rasomvandling

Den första delen av encoder-decoder-systemet använder Durham-rasöverföringsmodellen, som är förtränad på VGGFace2, för att generera proxy-målramar med den tidigare caucasian-till-afrikanska komponenten av Durham-forskningen. Detta producerar en platt överföring av rasrelaterade egenskaper, men innehåller inte variationer i färg och ton som representerar visuella fysiologiska indikatorer för patientens blodflödesstatus.

Transformationspipelinen från 2020 års forskning av Durham University, som delvis är inkorporerad i den nya UCLA-forskningen. Källa: https://arxiv.org/pdf/2004.08945.pdf

Transformationspipelinen från 2020 års forskning av Durham University, som delvis är inkorporerad i den nya UCLA-forskningen. Källa: https://arxiv.org/pdf/2004.08945.pdf. Klicka för att förstora.

En andra nätverk, kallad PhysResNet (PRN), tillhandahåller rPPG-komponenten. PhysResNet är tränad för att lära sig både det visuella utseendet och färgvariationerna som definierar subkutana blodvolymrörelser.

Nere till vänster, resultaten från 2020 års forskning av Durham, som saknar PPG-information. Mitten till vänster, PPG-informationen som inkorporerats i rasomvandlingen.

Nere till vänster, resultaten från 2020 års forskning av Durham, som saknar PPG-information. Mitten till vänster, PPG-informationen som inkorporerats i rasomvandlingen. Klicka för att förstora.

Arkitekturen som UCLA-projektet föreslår överträffar konkurrerande rPPG-tekniker, även i avsaknad av hudfärgsförstärkning, vilket representerar en 31-procentig förbättring av liknande tekniker som optimerats med MAE och RMSE.

UCLA-nätverket bevarar med framgång blodvolym och distributionsinformation.

UCLA-nätverket bevarar med framgång blodvolym och distributionsinformation. Klicka för att förstora.

UCLA-forskarna hoppas att framtida arbete kommer att ta itu med mer omfattande utmaningar för att åtgärda rasrelaterad bias inom detta område av medicinsk avbildning, och hoppas också att senare scheman kommer att producera högupplösta videor, eftersom systemet i fråga är begränsat till en upplösning på 80×80 pixlar – lämpligt för begränsningarna av telehälsovård, men inte idealiskt.

Brist på etniskt varierade dataset

De ekonomiska och praktiska omständigheterna som leder till rasligt varierade dataset har varit ett hinder för medicinsk forskning under flera år. Data tenderar att genereras lokalt, med många faktorer som bidrar till en frekvent caucasian-centrerad homogenitet av datasubjekt. Dessa inkluderar sammansättningen av minoritetsdemografi i städer där forskning sker, och andra socioekonomiska faktorer som kan påverka i vilken utsträckning icke-vita subjekt förekommer i västerländska dataset som forskarna önskar kunde ha en mer global tillämpbarhet.

I länder med en högre andel mörkhudade subjekt saknas ofta den nödvändiga utrustningen och resurserna för att samla in data.

En hudtonsvärldskarta för ursprungsbefolkning, från American Journal of Physical Anthropology.

En hudtonsvärldskarta för ursprungsbefolkning, från American Journal of Physical Anthropology.

För närvarande är mörkhudade subjekt påfallande underrepresenterade i rPPG-dataset, och utgör 0%, 5% och 10% av innehållet i de tre primära databaserna som används för detta ändamål.

Homogen caucasian data

2019 publicerades ny forskning i Science som fann att en algoritm som är allmänt spridd i amerikansk sjukvård var kraftigt biased till förmån för caucasian-subjekt. Studien fann att svarta personer var mindre benägna att hänvisas till specialiserad vård i triage och djupare nivåer av sjukhusinläggning.

Ytterligare forskning samma år från forskare i Malaysia och Australien etablerade det allmänna problemet med ‘eget ras-bias’ för dataset-generation över många regioner i världen, inklusive Asien.

Potentiella begränsningar av skala och arkitektur

Vissa av begränsningarna som har lett till dataset med begränsad etnicitet är praktiska snarare än etiska till sin natur. Ju bredare pluraliteten av bidragande data, desto bättre generaliserar den över subjekten som presenteras i den datan, men desto mindre är träningsrutinen benägen att intuitiva mönster inom någon enskild egenskap av data, inklusive ras, eftersom en mindre procent av tränings tid, uppmärksamhet och resurser är tillgängliga för varje identifierbar delmängd av data.

Detta kan leda till modeller som är allmänt tillämpliga men erhåller mindre specifika resultat, på grund av begränsningarna av datamängd, ekonomiska begränsningar av batch-storlek och praktiska begränsningar av den latenta utrymmet som en funktion av begränsade hårdvaruresurser.

I den andra änden, även om effektiva och granulära resultat kan erhållas genom att begränsa indata till en mer begränsad uppsättning egenskaper, inklusive etnicitet, är resultaten troligen “överanpassade” till den begränsade datan och inte allmänt tillämpliga, kanske inte ens över osynliga subjekt i samma geografiska område från vilket de ursprungliga dataset-subjekt erhölls.

Syntetiska avatarer för PPG-simulering

UCLA-papperet nämner också tidigare arbete från Microsoft Research 2020 om användningen av rasligt flexibla syntetiska avatarer, som utnyttjar 3D-bildsyntes för att skapa ansiktsvideor rika på PPG-information.

Syntetiska avatarer skapade av Microsoft Research, med ray-tracerade bilder som innehåller PPG-data. Källa: https://arxiv.org/pdf/2010.12949.pdf

Syntetiska avatarer skapade av Microsoft Research, med ray-tracerade bilder som innehåller PPG-data. Källa: https://arxiv.org/pdf/2010.12949.pdf. Klicka för att förstora.

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai