AI-modeller och plattformar
Dator kan identifiera 200 fågelarter från ett enda foto
Forskare från Duke University har använt maskinlärning för att träna en dator att identifiera upp till 200 olika arter av fåglar. Datorn behöver bara ett foto för att slutföra identifieringsprocessen. För en människa krävs ofta år av fågelskådning för att kunna identifiera olika arter från varandra.
Forskningen leddes av Duke universitets datavetenskapsstudent Chaofan Chen, tillsammans med undergraduate Oscar Li. Det arbetades också med av andra teammedlemmar i Prediction Analysis Lab, som leds av Duke-professorn Cynthia Rudin.
A.I. visar sitt tänkande
Medan identifieringsprocessen är imponerande, finns det en viktigare aspekt av utvecklingen. A.I.:n kan visa sitt tänkande, vilket gör det möjligt för även en oerfaren fågelskådare att förstå processen.
Det djupa neuronnätverket, eller algoritmer som baseras på hjärnans funktion, tränades med 11 788 foton. Fotona innehöll 200 olika arter av fåglar, allt från änder till kolibrier.
Forskarlaget behövde inte specifikt träna nätverket för att identifiera näbbar eller vingfjädrar. Istället kan nätverket ta ett foto av en fågel och identifiera vissa mönster i bilden. Det kan sedan ta dessa mönster och identifiera tidigare mönster som det redan har stött på i typiska artsegenskaper.
Enligt teamet skapar nätverket sedan en serie värmebilder som identifierar vissa egenskaper. Till exempel kan det skilja på en vanlig sångare och en huvsångare, tillsammans med olika egenskaper som en maskerad huvud och gul buk. Det visar sedan att dessa egenskaper är vad som ledde till identifieringen.
Till skillnad från andra system
Neuronnätverket kunde identifiera den korrekta arten upp till 84% av tiden. Detta är liknande med några av de bäst presterande systemen. Skillnaden är att dessa system inte förklarar tänkandeprocessen som detta.
Enligt Rudin är detta projekts mest revolutionerande aspekt att det tillhandahåller visualisering för vad djupa neuronnätverk ser när de tittar på en bild.
Denna teknik används också för närvarande på sociala medier för att identifiera misstänkta brottslingar i övervakningskameror och för att hjälpa autonoma fordon att identifiera trafikljus och fotgängare.
Deep learning-programvara kräver ofta inte att vara explicit programmerad för att lära sig från data, vilket inte är fallet med traditionell programvara. Men processen är inte alltid tydlig eller visad, så det är ofta svårt att förklara hur algoritmerna “tänker” när de klassificerar en bild.
I framtiden
Rudin och andra arbetar för närvarande med nya djupa inlärningsmodeller för A.I., som driver fältet framåt. De nya modellerna kan förklara sin resonemang och identifieringsprocess. Det hjälper forskarna att se från början till slut, och det gör det lättare att identifiera orsaken till ett misstag eller problem.
Rudin och hennes team kommer att arbeta med att använda algoritmen inom det medicinska området. Den kunde identifiera vissa problemområden inom medicinska bilder som mammografier. Det skulle hjälpa medicinska yrkesverksamma att upptäcka knölar, kalkifieringar och andra tecken på bröstcancer.
Enligt Rudin imiterar nätverket det sätt som läkare gör en diagnos.
“Det är baserat på resonemang”, sa Rudin. “Vi hoppas att vi kan bättre förklara för läkare eller patienter varför deras bild klassificerades av nätverket som antingen malign eller godartad.”
Teamet kommer att presentera en rapport som innehåller deras forskning vid den trettiotredje konferensen om neural information och bearbetning (NeurlIPS2019) i Vancouver den 12 december.
Studien inkluderar också författarna Daniel Tao och Alina Barnerr från Duke och Jonathan Su från MIT Lincoln Laboratory.












