Etik
Forskare vänder sig till neurovetenskapsmän för att övervinna dataset-bias

Ett team av forskare vid MIT, Harvard University och Fujitsu, Ltd. undersökte hur en maskinläringsmodell kan övervinna dataset-bias. De använde en neurovetenskaplig approach för att studera hur träningsdata påverkar en artificiell neural nätverks förmåga att känna igen objekt den aldrig har sett.
Forskningen publicerades i Nature Machine Intelligence.
Mångfald i träningsdata
Studiens resultat visade att mångfald i träningsdata påverkar om ett neuronnätverk kan övervinna bias. Men data-mångfald kan också ha en negativ inverkan på nätverkets prestanda. Forskarna visade också att sättet ett neuronnätverk tränas på kan också påverka om det kan övervinna en biased dataset.
Xavier Boix är en forskare i avdelningen för hjärna och kognitiva vetenskaper (BCS) och centrum för hjärnor, sinnen och maskiner (CBMM). Han är också senior författare till artikeln.
“Ett neuronnätverk kan övervinna dataset-bias, vilket är uppmuntrande. Men den viktigaste slutsatsen här är att vi måste ta hänsyn till data-mångfald. Vi måste sluta tro att om du bara samlar in en massa rådata, så kommer det att fungera. Vi måste vara mycket försiktiga när vi designar dataset från början”, säger Boix.
Teamet antog en neurovetenskapsmans synsätt för att utveckla den nya approachen. Enligt Boix är det vanligt att använda kontrollerade dataset i experiment, så teamet byggde dataset som innehöll bilder av olika objekt i olika poser. De kontrollerade kombinationerna så att vissa dataset var mer mångfacetterade än andra. Ett dataset med fler bilder som visar objekt från bara en synvinkel är mindre mångfacetterat, medan ett med fler bilder som visar objekt från flera synvinklar är mer mångfacetterat.
Forskarna tog dessa dataset och använde dem för att träna ett neuronnätverk för bildklassificering. De studerade sedan hur bra det var på att identifiera objekt från synvinklar som nätverket inte såg under träningsprocessen.
De fann att de mer mångfacetterade dataseten tillåter nätverket att bättre generalisera nya bilder eller synvinklar, och detta är avgörande för att övervinna bias.
“Men det är inte som att mer data-mångfald alltid är bättre; det finns en spänning här. När neuronnätverket blir bättre på att känna igen nya saker det inte har sett, då blir det svårare för det att känna igen saker det redan har sett”, säger Boix.
Metoder för att träna neuronnätverk
Teamet fann också att en modell som tränas separat för varje uppgift är bättre på att övervinna bias jämfört med en modell som tränas för båda uppgifterna tillsammans.
“Resultaten var verkligen slående. Faktum är att den första gången vi gjorde detta experiment, trodde vi att det var ett fel. Det tog oss flera veckor att förstå att det var ett riktigt resultat eftersom det var så oväntat”, fortsätter Boix.
En djupare analys visade att neuronnetspecialisering är involverad i denna process. När neuronnätverket tränas för att känna igen objekt i bilder, dyker två typer av neuroner upp. En neuron specialiserar sig på att känna igen objektkategorin medan den andra specialiserar sig på att känna igen synvinkeln.
De specialiserade neuronerna blir mer framträdande när nätverket tränas för att utföra uppgifter separat. Men när ett nätverk tränas för att utföra båda uppgifterna samtidigt, blir vissa neuroner utspädda. Det betyder att de inte specialiserar sig på en uppgift, och de är mer benägna att bli förvirrade.
“Men nästa fråga nu är, hur kom dessa neuroner dit? Du tränar neuronnätverket och de dyker upp från läroprocessen. Ingen sa till nätverket att inkludera dessa typer av neuroner i dess arkitektur. Det är det fascinerande”, säger Boix.
Forskarna kommer att undersöka denna fråga i sin framtida forskning, samt applicera den nya approachen på mer komplexa uppgifter.












