AI-modellen en platforms
Wilson Pang, Chief Technology Officer bij Appen – Interview Serie

Wilson Pang is de Chief Technology Officer bij Appen, waar hij een groep wereldklasse datawetenschappers, ingenieurs en productmanagers leidt om de kracht van technologie en mensen te combineren om AI-gegevensproblemen op te lossen.
In dit interview bespreken we AI-ethiek, Appen’s 2020 State of AI and Machine Learning Report en huidige industrie-uitdagingen.
Wat was het dat u persoonlijk aantrok tot software-engineering en datawetenschap?
Ik kreeg de kans om 10 jaar geleden te werken aan data en AI. In de AI-wereld zijn ontwikkelaars niet langer de logica in code aan het controleren, maar beslist de data de logica van het AI-model, wat fascinerend is. Ik begon mijn carrière als ontwikkelaar bij IBM, waar ik grote systemen bouwde voor banken, telecomoperators en effectenbeurzen. Ik was enthousiast over de kracht van software en AI.
Ik ben ook gelukkig dat ik heb kunnen zien hoe data en machine learning helpen om bedrijven te laten groeien. Mijn team bij eBay gebruikte AI om kopersaankopen te verhogen, waardoor de omzet met tientallen miljoenen dollars toenam. We gebruikten AI om de interne efficiëntie te verhogen en de operationele kosten aanzienlijk te verlagen voor Trip.com. Nu bij Appen helpen we bedrijven uit allerlei branches om AI te gebruiken om het succes van hun bedrijf te stimuleren.
Kunt u enkele van Appen’s AI- en datalabel-opties beschrijven?
We zijn een trainingsgegevensleverancier die samenwerkt met meer dan 1 miljoen freelancers om afbeeldingen, tekst, spraak, audio, video en andere gegevens te verzamelen en te labelen. Deze freelancers wonen in meer dan 130 landen en spreken 180 talen en dialecten, wat ons de mogelijkheid geeft om hoge kwaliteit gegevens voor AI-projecten te bieden. We hebben ook professionele teams die meer dan 20 jaar ervaring hebben in AI-gegevens en veel kennis hebben over hoe ze de trainingsgegevens goed kunnen krijgen. Ten slotte hebben we een toonaangevend AI-geassisteerd annotatieplatform met ingebouwde functies om kwaliteit en productiviteit te garanderen. Onze klanten kunnen kiezen tussen onze beheerde serviceloplossing, waarbij we samenwerken met hun team, of het self-serviceplatform. Ons AI-geassisteerd datalabel-platform geeft klanten de mogelijkheid om projecten te beheren, samen met machine learning-geassisteerde tools om kwaliteit, nauwkeurigheid en annotatiesnelheid te verbeteren.
Met meer dan 20 jaar ervaring bieden onze diensten wereldklasse trainingsgegevens, het meest geavanceerde AI-geassisteerde datalabel-platform en een diverse, wereldwijde crowd om hoge kwaliteit gegevens te garanderen.
Zijn er enkele open source-datasets beschikbaar?
Appen heeft verschillende open source-datasets online beschikbaar, van afbeeldingsannotatie tot handschriftherkenningssoftware. Deze datasets zijn gratis te downloaden en kunnen worden gebruikt om uw AI-model te helpen bouwen en trainen. Een van de meest interessante datasets die beschikbaar zijn, is die over nucleussegmentatie van medische beelden. De dataset bevat meer dan 21.000 nuclei die zijn geannoteerd en gevalideerd door medische experts.
Wat was uw grootste persoonlijke inzicht uit de 2020 State of AI and Machine Learning Report?
Het meest interessante onderdeel van het rapport was de toename van de betrokkenheid van het C-level. Ik had erover gehoord, maar om te zien dat de toename 31% was ten opzichte van vorig jaar, was een grote verrassing. AI wordt een onderdeel van de kern van het bedrijf en niet alleen van de technologie-leiders.
Een van de zorgen in het rapport is dat slechts 25% van de bedrijven aangaf dat onbevooroordeelde AI een missie-kritiek punt is. Gelooft u dat dit te wijten is aan een gebrek aan onderwijs over het belang van het verwijderen van AI-vooringenomenheid? Wat moet er gebeuren om deze statistieken te verbeteren?
Ja, onderwijs is de eerste stap om deze statistiek te verbeteren. Een AI-model dat is gebouwd op vooringenomen gegevens, zal vooringenomen resultaten opleveren en nooit volledig succesvol zijn. Bedrijfsleiders moeten leren over het belang van het hebben van onbevooroordeelde gegevens en hoe dat leidt tot een succesvolle implementatie.
Zijn er enkele AI-ethiek die bedrijven in overweging moeten nemen bij het werken met AI en grote datasets?
Het is belangrijk om te kijken waar de gegevens vandaan komen. Zijn die gegevens op een ethische manier verkregen en onbevooroordeeld? Wanneer u naar de bron kijkt, wilt u weten of de mensen een eerlijk loon kregen en of de gegevens afkomstig zijn van een diverse groep. We hebben onlangs onze Crowd Code of Ethics gelanceerd ter ondersteuning van inclusiviteit, diversiteit, eerlijk loon en communicatie voor onze contributors.
Wat ziet u als de huidige grootste industrie-uitdaging?
Gegevensgebrek en gegevensbeheer zijn de grootste uitdagingen voor de industrie. Teams hebben veel beslissingen die ze moeten nemen over de gegevens en veel hebben moeite met het herkennen van wat ze nodig hebben. Ze moeten weten wat ze hebben, waar het vandaan komt en wat ze nog nodig hebben. Al dat gegevensbeheer is belangrijk om een AI-model te bouwen en te trainen. Gegevensgebrek kan leiden tot een vooringenomen model, dat op zijn beurt niet succesvol zal zijn.
Appen heeft de State of AI and Machine Learning Reports al vele jaren uitgebracht. Wanneer werd de eerste rapport uitgebracht en wat zijn enkele van de grootste veranderingen die zijn waargenomen sinds het eerste rapport?
Het eerste rapport werd uitgebracht in 2015 en de grootste verandering die we hebben gezien, is de verandering in eigendom van AI-projecten. Het eerste rapport werd voornamelijk beantwoord door datawetenschappers die AI beheerden voor hun bedrijven. Vandaag zegt 71% dat het C-level de eigenaar is, wat een enorme verschuiving in perspectief aangeeft van AI als kritieke component van bedrijven. Datawetenschappers hebben veel uitdagingen gehad, van een gebrek aan middelen om waardevolle inzichten uit de gegevens te halen tot onduidelijke doelen en onrealistische verwachtingen. Echter, een van de belangrijkste uitdagingen blijft hetzelfde rondom gegevens en gegevensbeheer.
Is er nog iets dat u zou willen delen over Appen?
Op 16 juli zijn we verheugd om de eerste virtuele ronde tafel over het lanceren van AI in de echte wereld op Appen.com te organiseren. De vierdelige serie presenteert industrieleiders die hun persoonlijke ervaringen en inzichten delen over hun eigen AI-reizen, om anderen te helpen hun AI-initiatieven te versnellen. Om te slagen, moeten bedrijven bereid zijn om verschillende gemeenschappelijke uitdagingen rondom gegevens, ethiek, mensen en levenscycli te overwinnen. In de eerste editie brengen we toonaangevende experts samen om te delen wat het voor hen en hun organisatie betekent om deel te nemen aan het creëren van verantwoorde AI.
Bedankt voor het interview. Lezers kunnen de Appen’s 2020 State of AI and Machine Learning Report lezen of de Appen website bezoeken.












