Intervjuer

Phil Hall, Chief Growth Officer i LXT – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

LXTs Chief Growth Officer Phil Hall er en tidligere Appen-ansatt og Forbes Technology Council-medlem. I hans ledelsesrolle i Appen ledet han en avdeling på over 1 000 ansatte og spilte en nøkkelrolle i å oppnå 17 påfølgende år med omsetningsvekst med jevnt sterke resultater. I hans nåværende rolle i LXT arbeider han med et håndplukket team av eksperter for å nå ambisiøse vekstmaal.

LXT er en fremvoksende leder innen AI-treningdata for å drive intelligent teknologi for globale organisasjoner, inkludert verdens største teknologiselskaper. I samarbeid med et internasjonalt nettverk av bidragsytere samler LXT inn og annoterer data på flere modaliteter med den hastighet, skala og fleksibilitet som kreves av bedriftene. De har en global ekspertise som omfatter over 115 land og 750 språklokale. Grunnlagt i 2010 er LXT hovedkontor i Toronto, Canada, med tilstedeværelse i USA, Australia, Egypt, Storbritannia og Tyrkia. Selskapet betjener kunder i Nord-Amerika, Europa, Asia-Stillehavet og Midtøsten.

Når oppdaget du først at du var lidenskapelig opptatt av språk?

Jeg har vært fascinert av språk så lenge jeg kan huske, men når det gjelder min direkte engasjement med språk og lingvistikk, var det et enkelt avgjørende punkt for meg. Vi innsett at en av våre barn var dyslektisk, og da vi snakket med skolen om ekstra støtte, sa de at selv om det var programmer de kunne få tilgang til, var det også ting jeg kunne gjøre som frivillig på skolen for å hjelpe vår datter og andre barn. Det gikk bra, og derfra gikk jeg videre til å studere lingvistikk og fant meg selv undervise på to av universitetene her i Sydney.

Hva var det som inspirerte deg til å skifte fokus fra lingvistikk til taledata?

Sydney-baserte Appen var nettopp i ferd med å gå fra å være en operasjon drevet fra et ekstra rom i et hjem til å bli en fullstendig kommersiell operasjon. Jeg ble fortalt at de lette etter lingvister (kanskje mer nøyaktig, en lingvist!) og jeg ble introdusert for grunnleggerne Julie og Chris Vonwiller. Overgangen var gradvis og strakk seg over omtrent to år. Jeg var motvillig til å forlate undervisningen – å arbeide med høytpresterende studenter var både inspirerende og veldig morsomt. Men spesielt under disse pionerårene løste jeg vanskelige problemer sammen med verdens ledende språkteknologi-eksperter, og spenningene var høye. Mye av det som tas for gitt i dag, var svært utfordrende på den tiden.

Hva var det som motiverte deg til å komme ut av pensjon og bli med i LXT?

Dette er et interessant spørsmål, for jeg nøt meg selv i pensjon. Faktisk var vår medgrunnlegger og CEO Mohammad Omar kom til meg måneder før jeg svarte på hans opprinnelige forespørsel, da jeg levde et avslappet livsstil og hadde ikke virkelig vurdert å returnere til fulltidsarbeid. Etter å ha gått med på å ta den første samtalen hvor Mo spurte om muligheten til å bli med i LXT, ventet jeg bare å lytte høflig og avslå.

Men til slutt var muligheten bare for god til å motstå.

Mens jeg snakket med Mohammad og andre medlemmer av LXT-teamet, gjenkjente jeg umiddelbart en delt lidenskap for språk. Teamet som Mohammad hadde samlet, var fylt med kreative tenkere med ubegrenset energi som var fullstendig dedikert til selskapets misjon.

Da jeg lærte mer om muligheten med LXT, innsett jeg at det var en mulighet jeg ikke ville gå glipp av. Her var et selskap med massiv potensial til å utvide og vokse i et område jeg er lidenskapelig opptatt av. Og ettersom markedet for AI fortsetter å vokse eksponentielt, er muligheten til å hjelpe flere organisasjoner å gå fra eksperimentering til produksjon en spennende en som jeg er svært glad for å være en del av.

Hva er noen av de nåværende utfordringene bak innhenting av data i stor skala?

Utfordringene er like varierte som de anvendelsene som driver dem.

Fra et praktisk perspektiv inkluderer utfordringene autentisitet, pålitelighet, nøyaktighet, sikkerhet og å sikre at dataene er egnet for formålet – og det er uten å ta hensyn til den økende mengden juridiske og etiske utfordringer som er innebygget i datainnsamling.

For eksempel krever utviklingen av teknologi for å støtte selvkjørende kjøretøy innhenting av ekstremt store volumer av data over en mengde scenarier så at bilen vil forstå hvordan den skal reagere på virkelige verdenssituationer. Det finnes endeløse mengder av edge-cases som en kan møte når en kjører, så algoritmene som driver disse kjøretøyene trenger datasamlinger som dekker alt fra gater til stoppskilt til fallende objekter. Og hvis en så multipliserer det med antall værforhold som kan oppstå, øker mengden av treningdata som trengs eksponentielt. Bil-selskaper som går inn i det selvstyrte området, trenger å etablere en pålitelig datapipeline, og å gjøre det på egen hånd ville kreve en enorm mengde ressurser.

Et annet eksempel er utvidelsen av en eksisterende tale-AI-produkt til nye markeder for å fange markedsshare og nye kunder. Dette krever uunngåelig taledata, og for å oppnå nøyaktighet er det kritisk å kilde taledata fra native talere over en mengde demografiske profiler. Når dataene er samlet inn, må talefilene transkriberes for å trene produktets NLP-algoritmer. Å gjøre dette for flere språk og i de data-volumer som er nødvendig for å være effektiv, er ekstremt utfordrende for selskaper å gjøre på egen hånd, spesielt hvis de mangler intern ekspertise på dette feltet.

Disse er bare to eksempler på de mange utfordringene som finnes med datainnsamling for AI i stor skala, men som du kan forestille deg, hjemmeautomatisering, mobil enhet- og biometrisk datainnsamling har hver sine spesifikke utfordringer.

Hva er de nåværende måtene LXT innhenter og annoterer data på?

Hos LXT innhenter og annoterer vi data forskjellig for hver kunde, da alle våre engasjementer er tilpasset for å møte våre kunders spesifikasjoner. Vi arbeider over en mengde datatyper, inkludert audio, bilde, tale, tekst og video. For datainnsamlinger arbeider vi med et globalt nettverk av underleverandører for å innhente data i disse forskjellige modalitetene. Innsamlinger kan variere fra å innhente data i virkelige verdenssettinger som hjem, kontor eller i bil, til i studio med erfarne ingeniører i tilfelle visse taledatainnsamlingsprosjekter.

Våre data-annoteringsmuligheter omfatter også flere modaliteter. Vår erfaring begynte i taleområdet og over de siste 12 årene har vi utvidet oss til over 115 land og mer enn 750 språklokale. Dette betyr at selskaper av alle størrelser kan stole på LXT for å hjelpe dem å penetrere en rekke markeder og fange nye kundesegmenter. Mer nylig har vi utvidet oss til tekst, bilde og video-data, og vår interne plattform brukes til å levere høykvalitetsdata til våre kunder.

Et annet spennende område for vekst for oss har vært vårt sikre annoteringsarbeid. Bare i år utvidet vi vårt ISO 27001-sikre anlegg fra to til fem lokasjoner verden over. Vi har nå utviklet en playbook som gjør det mulig for oss å etablere nye anlegg på få måneder. Tjenestene vi fokuserer på i disse sikre anleggene er for tiden taledata-annotering og transkripsjon, men de kan brukes til annotering over mange datatyper.

Hvorfor er innhenting av data på denne måten en overlegen alternativ til syntetisk data?

Syntetisk data er en spennende utvikling innen AI og er godt egnet for bestemte anvendelser, spesielt edge-cases som er vanskelige å fange i den virkelige verden. Bruken av syntetisk data er på fremmarsj, spesielt i de tidlige fasene av AI-maturitet da selskaper fortsatt er i eksperimenteringsmodus. Men vår egen forskning viser at når organisasjoner modner sine AI-strategier og skyver flere modeller inn i produksjon, er de mye mer sannsynlig til å bruke overvåket eller semi-overvåket maskinlæring-metoder som avhenger av menneske-annotert data.

Mennesker er enkelt bedre enn datamaskiner til å forstå nyansene for å skape de dataene som trengs for å trene ML-modeller til å fungere med høy nøyaktighet, og menneskelig tilsyn er også kritisk for å redusere bias.

Hvorfor er denne dataen så viktig for tale og naturlig språkbehandling?

For tale- og naturlig språkbehandlingsalgoritmer å fungere effektivt i sine mentede markeder, trenger de å bli trenet med store volumer av data innhentet fra native talere som har den kulturelle konteksten til sluttbrukerne de representerer. Uten denne dataen, vil tale-AI-tilpasningen ha alvorlige begrensninger.

I tillegg må miljøet tas med i betraktning når det gjelder innhenting av taledata. Hvis tale-AI-løsningen som blir trenet skal brukes i en bil, for eksempel, er det forskjellige vei- og værforhold som påvirker tale og som må tas med i betraktning. Disse er komplekse scenarier hvor en erfaren datapartner kan hjelpe.

Er det noe annet du vil dele om LXT?

Først og fremst ønsker jeg å takke deg for muligheten til å dele vår historie! Jeg vil gjerne understreke at vårt selskap er dedikert til å hjelpe organisasjoner av alle størrelser å lykkes med sine AI-initiativer. Vi har vært fokusert på å levere høyt tilpassede AI-data til selskaper over hele verden i over 12 år og vi ville gjerne knytte kontakt med noen som søker å skape en pålitelig datapipeline for å støtte sine AI-prosjekter.

Takk for det flotte intervjuet, lesere som ønsker å lære mer kan besøke LXT

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.