Interviews

Phil Hall, Chief Growth Officer i LXT – Interviewserie

mm
Føj Unite.AI til dine foretrukne kilder på Google

LXT’s Chief Growth Officer Phil Hall er en tidligere Appen-direktør og Forbes Technology Council-medlem. I sin ledelsesrolle i Appen ledede han en afdeling på over 1.000 medarbejdere og spillede en nøglerolle i at opnå 17 på hinanden følgende år med omsætningsvækst med konstant stærk rentabilitet. I sin nuværende rolle i LXT arbejder han med et håndplukket hold af eksperter for at opnå ambitiøse vækst mål.

LXT er en fremvoksende leder inden for AI-træningsdata til at aktivere intelligent teknologi for globale organisationer, herunder verdens største teknologivirksomheder. I partnerskab med et internationalt netværk af bidragydere indsamler og annoterer LXT data på tværs af multiple modaliteter med den hastighed, skala og fleksibilitet, der kræves af virksomhederne. De har en global ekspertise, der dækker over 115 lande og 750 sproglokaler. Grundlagt i 2010 har LXT hovedsæde i Toronto, Canada, og er tilstede i USA, Australien, Ægypten, Storbritannien og Tyrkiet. Virksomheden betjener kunder i Nordamerika, Europa, Asien-Stillehavet og Mellemøsten.

Hvornår opdagede du først, at du var passioneret om sprog?

Jeg har været fascineret af sprog, så længe jeg kan huske, men i forhold til min direkte beskæftigelse med sprog og lingvistik, var der et enkelt væsentligt vendepunkt for mig. Vi opdagede tidligt, at en af vores børn var dyslektisk, og da vi talte med skolen om ekstra støtte, sagde de, at selvom der var programmer, de kunne tilgå, var der også ting, jeg kunne gøre som frivillig på skolen for at hjælpe vores datter og andre børn. Det gik godt, og derefter gik jeg videre til at studere lingvistik og fandt mig selv undervisende på to af universiteterne her i Sydney.

Hvad inspirerede dig til at skifte fokus fra lingvistik til taledata?

Sydney-baserede Appen var lige i færd med at gå fra at være en operation, der blev kørt fra et ekstra rum i et hjem, til at være en fuldt udbygget kommerciel operation. Jeg blev fortalt, at de ledte efter lingvister (muligvis mere præcist, en lingvist!), og jeg blev introduceret til grundlæggerne Julie og Chris Vonwiller. Overgangen var gradvis og strakte sig over omkring to år. Jeg var tilbageholdende med at forlade undervisningen – at arbejde med højt præsterende studerende var både inspirerende og meget sjovt. Men især under disse pionerår løste jeg svære problemer sammen med verdens førende sprogteknologi-eksperter, og spændingsniveauet var højt. Meget af det, der tages for givet i dag, var meget udfordrende på det tidspunkt.

Hvad motiverede dig til at komme ud af pension og tilslutte dig LXT?

Det er et interessant spørgsmål, da jeg bestemt nød mig selv i pension. Faktisk kontaktede vores medstifter og administrerende direktør Mohammad Omar mig måneder før jeg svarede på hans første henvendelse, da jeg levede en afslappet livsstil og ikke havde overvejet at vende tilbage til fuldtidsarbejde. Efter at have accepteret at tage det første opkald, hvor Mo spurgte om muligheden for at tilslutte sig LXT, forventede jeg bare at lytte høfligt og afslå.

Men til sidst var muligheden simpelthen for god at modstå.

Under samtalen med Mohammad og de andre medlemmer af LXT-holdet genkendte jeg straks en fælles passion for sprog. Holdet, som Mohammad havde samlet, var fyldt med kreative tænkere med ubegrænset energi, der var fuldt engageret i virksomhedens mission.

Da jeg lærte mere om muligheden med LXT, indså jeg, at det var en mulighed, jeg ikke ville gå glip af. Her var en virksomhed med massiv potentiale til at udvide og vokse i et område, jeg er passioneret om. Og da markedet for AI fortsætter med at vokse eksponentielt, er muligheden for at hjælpe flere organisationer med at gå fra eksperimenter til produktion en spændende mulighed, som jeg er meget glad for at være en del af.

Hvad er nogle af de nuværende udfordringer ved at indsamle data i stor skala?

Udfordringerne er lige så varierede som de anvendelser, der driver dem.

Fra et praktisk perspektiv omfatter udfordringer ægthed, pålidelighed, nøjagtighed, sikkerhed og sikring af, at data er egnede til formålet – og det er uden at tage hensyn til det voksende antal juridiske og etiske udfordringer, der er indebygget i dataindsamling.

For eksempel kræver udviklingen af teknologi til støtte for selvstændige køretøjer indsamling af ekstremt store mængder data på tværs af multiple scenarier, så bilen kan forstå, hvordan den skal reagere på virkelige verdenssituationer. Der er utallige antal edge-cases, man kan møde, når man kører, så algoritmerne, der driver disse køretøjer, behøver datasæt, der dækker alt fra gader til stopskilte til faldende objekter. Og derefter, hvis man multiplicerer det med antallet af vejrforhold, der kan optræde, øges mængden af træningsdata, der er nødvendig, eksponentielt. Bilvirksomheder, der går ind i det selvstændige område, har brug for at etablere en pålidelig datapipeline, og det ville kræve en masse ressourcer, hvis de skulle gøre det på egen hånd.

Et andet brugstilfælde er udvidelsen af en eksisterende tale-AI-produkt til nye markeder for at tiltrække markedsoverskud og nye kunder. Dette kræver uundgåeligt sprogdata, og for at opnå nøjagtighed er det kritisk at indsamle taledata fra native talere på tværs af en række demografiske profiler. Når dataene er indsamlet, skal talefilene transkriberes for at træne produktets NLP-algoritmer. At gøre dette for multiple sprog og i de data-volumener, der er nødvendige for at være effektive, er ekstremt udfordrende for virksomheder at gøre på egen hånd, især hvis de mangler intern ekspertise på dette område.

Disse er kun to eksempler på de mange udfordringer, der findes med dataindsamling til AI i stor skala, men som du kan forestille dig, har hjemautomatisering, mobilenheds- og biometrisk dataindsamling hver sine specifikke udfordringer.

Hvordan indsamler og annoterer LXT data i øjeblikket?

Hos LXT indsamler og annoterer vi data på forskellig vis for hver kunde, da alle vores engagementer er tilpasset for at opfylde vores kunders specifikationer. Vi arbejder på tværs af en række datatyper, herunder audio, billeder, tale, tekst og video. Til dataindsamling arbejder vi med et globalt netværk af underleverandører for at indsamle data i disse forskellige modaliteter. Indsamlinger kan variere fra at indsamle data i virkelige verdenssituationer, såsom hjem, kontorer eller i bil, til i studiet med erfarne ingeniører i tilfælde af bestemte taledataindsamlingsprojekter.

Vores data-annoteringskapaciteter dækker også multiple modaliteter. Vores erfaring begyndte i taleområdet, og over de seneste 12 år er vi udvidet til over 115 lande og mere end 750 sproglokaler. Dette betyder, at virksomheder af alle størrelser kan stole på LXT til at hjælpe dem med at trænge ind på en række markeder og tiltrække nye kundesegmenter. Mere nylig er vi udvidet til tekst-, billed- og video-data, og vores interne platform bruges til at levere højkvalitetsdata til vores kunder.

Et andet spændende område for vækst for os har været vores sikre annotationsarbejde. I år har vi udvidet vores ISO 27001-sikre facilitetsfodtryk fra to til fem lokaliteter på verdensplan. Vi har nu udviklet en playbook, der gør det muligt for os at etablere nye faciliteter på få måneder. De tjenester, vi fokuserer på i disse sikre faciliteter, er i øjeblikket taledata-annotation og transkription, men de kan bruges til annotation på tværs af mange datatyper.

Hvorfor er det bedre at indsamle data på denne måde end at bruge syntetisk data?

Syntetisk data er en spændende udvikling inden for AI og er velegnet til bestemte brugstilfælde, især edge-cases, der er svære at indfange i den virkelige verden. Brugen af syntetisk data er stigende, især i de tidlige faser af AI-moden, da virksomheder stadig er i eksperimenteringsmodus. Men vores egen forskning viser, at når organisationer modner deres AI-strategier og sætter flere modeller i produktion, er de langt mere tilbøjelige til at bruge overvåget eller semi-overvået maskinlæringsmetoder, der afhænger af menneske-annoterede data.

Mennesker er simpelthen bedre end computere til at forstå nuancerne og skabe de data, der er nødvendige for at træne ML-modeller til at fungere med høj nøjagtighed, og menneskelig oversigt er også afgørende for at reducere bias.

Hvorfor er denne data så vigtig for tale og naturlig sprogbehandling?

Tale- og naturlig sprogbehandlingsalgoritmer har brug for at blive trænet med store mængder data indsamlet fra native talere, der har den kulturelle kontekst for de slutbrugere, de repræsenterer. Uden denne data vil tale-AI-adoptionsmulighederne have alvorlige begrænsninger.

Dertil skal miljøet tages i betragtning, når der indsamles taledata. Hvis tale-AI-løsningen, der trænes, skal bruges i en bil, er der for eksempel forskellige vej- og vejrforhold, der påvirker tale og skal tages i betragtning. Disse er komplekse scenarier, hvor en erfaren datapartner kan hjælpe.

Er der noget andet, du gerne vil dele om LXT?

Først og fremmest tak for muligheden for at dele vores historie! Jeg vil gerne fremhæve, at vores virksomhed er dedikeret til at hjælpe organisationer af alle størrelser med at lykkes med deres AI-initiativer. Vi har fokuseret på at levere højtilpassede AI-data til virksomheder på verdensplan i over 12 år og vil gerne være i kontakt med enhver, der søger at oprette en pålidelig datapipeline for at understøtte deres AI-projekter.

Tak for det gode interview, læsere, der ønsker at lære mere, skal besøge LXT

Antoine er en visionær leder og medstifter af Unite.AI, drevet af en urokkelig passion for at forme og fremme fremtiden for AI og robotteknologi. En serieiværksætter, han tror, at AI vil være lige så omvæltende for samfundet som elektricitet, og han bliver ofte fanget i at tale om potentialet for omvæltende teknologier og AGI.

Som en futurist, er han dedikeret til at udforske, hvordan disse innovationer vil forme vores verden. Derudover er han grundlægger af Securities.io, en platform, der fokuserer på at investere i skarp teknologi, der gendefinerer fremtiden og omformer hele sektorer.