Haastattelut
Phil Hall, LXT:n kasvua johtava johtaja – Haastattelusarja

LXT:n kasvua johtava johtaja Phil Hall on entinen Appen-johtaja ja Forbes Technology Council -jäsen. Hänen johdollaan Appenissa hän johti yli 1 000 työntekijän osastoa ja oli avainasemassa saavuttamassa 17 peräkkäistä vuotta kasvua vahvan kannattavuuden kanssa. Nykyisessä roolissaan LXT:ssä hän työskentelee käsivalitun asiantuntijatiimin kanssa saavuttaakseen kunnianhimoisia kasvutavoitteita.
LXT on nousussa johtajaksi tekoälykoulutusdataa varten, joka mahdollistaa älykkään teknologian maailmanlaajuisille organisaatioille, mukaan lukien maailman suurimmat teknologiayritykset. Kansainvälisen avustajaverkoston kanssa LXT kerää ja annotoi dataa useilla eri tavoilla nopeasti, suurten määrien ja joustavasti yritysten tarpeisiin. Heillä on maailmanlaajuinen asiantuntemus, joka kattaa yli 115 maata ja 750 kielen paikallista versiota. LXT perustettiin vuonna 2010, ja sen pääkonttori sijaitsee Torontossa, Kanadassa, ja sillä on toimintaa Yhdysvalloissa, Australiassa, Egyptissä, Iso-Britanniassa ja Turkissa. Yritys palvelee asiakkaita Pohjois-Amerikassa, Euroopassa, Aasiassa ja Tyynenmeren alueella sekä Lähi-idässä.
Milloin sinä alun perin löysit, että olet intohimoisen kiinnostunut kielestä?
Olen ollut kiinnostunut kielestä niin kauan kuin muistan, mutta suoraan sanottuna kiinnostukseni kieleen ja kielitieteeseen alkoi, kun ymmärsin, että yksi lapsistamme on dyslektinen, ja kun puhuimme koulun kanssa lisätuesta, he sanoivat, että vaikka heillä oli ohjelmia, joista voimme hyötyä, minulla oli myös mahdollisuus toimia vapaaehtoisena koulussa auttaaksesi tytärtäni ja muita lapsia. Se sujui hyvin, ja siitä lähtien aloin opiskella kielitiedettä ja opettaa kahdessa yliopistossa Sydneyssä.
Opettaminen kieltä edelsi siirtymistäsi puheen data-tilaan, mitä inspiraatio johti sinun fokuksesi muutokseen?
Sydneyssä toimiva Appen oli juuri siirtymässä toiminnasta, joka oli käynnissä kotitilassa, täysimittaiseen kaupalliseen toimintaan. Minulle kerrottiin, että he etsivät kielitieteilijöitä (tarkemmin sanottuna kielitieteilijää!), ja minut esiteltiin perustajille Julie ja Chris Vonwiller. Siirtymä oli asteittainen ja kesti noin kaksi vuotta. Olin epäröivä jättää opettaminen – työskennellä korkean tason opiskelijoiden kanssa oli sekä inspiroivaa että paljon hauskaa. Mutta erityisesti niiden uranuurtajavuosina minun piti ratkaista vaikeita ongelmia maailman johtavien kieliteknologian asiantuntijoiden rinnalla, ja jännitystaso oli korkea. Paljon siitä, mitä otetaan nykyään itsestäänselväksi, oli haasteellista silloin.
Siirryit eläkkeeltä LXT:hen. Mitä motivi sinun tekemään tämän?
Se on mielenkiintoinen kysymys, koska nautin eläkkeestäni. Todella, meidän perustajan ja toimitusjohtajan Mohammad Omarin lähestyi minua useita kuukausia ennen kuin vastasin hänen aloittavansa tiedustelun, koska olin eläkkeellä ja en ollut ajatellut paluuta täysipäiväiseen työhön. Kun Mo kysyi mahdollisuudesta liittyä LXT:hen, odotin kuulevani hänen ehdotuksensa ja kieltäytyä.
Mutta lopulta mahdollisuus oli liian hyvä vastustamaton.
Puhuessani Mohammad ja muiden LXT-tiimin jäsenten kanssa, tunnistin välittömästi jaetun intohimon kieltä kohtaan. Mohammad kokoama tiimi oli täynnä luovia ajattelijoita, joilla oli rajaton energia ja jotka olivat täysin sitoutuneita yrityksen tehtävään.
Kun opin enemmän LXT:n mahdollisuuksista, ymmärsin, että se oli mahdollisuus, jota en halunnut jättää väliin. Tässä oli yritys, jolla oli valtava potentiaali laajentaa ja kasvaa alueella, josta olen intohimoisen kiinnostunut. Ja kun tekoälymarkkinat jatkavat kasvuaan eksponentiaalisesti, on jännittävää auttaa enemmän organisaatioita siirtymään kokeilusta tuotantoon.
Mitkä ovat joitain nykyisiä haasteita datan hankkimisessa suuressa mittakaavassa?
Haasteet ovat yhtä moninaisia kuin sovellukset, jotka niitä ohjaavat.
Käytännöllisestä näkökulmasta haasteisiin kuuluvat autenttisuus, luotettavuus, tarkkuus, turvallisuus ja varmistaminen, että data on sovellettavissa tarkoitukseen – ja se on ilman ottaa huomioon kasvavaa määrää lakien ja eettisten haasteiden määrää datan hankinnassa.
Esimerkiksi teknologian kehittäminen autonomisten ajoneuvojen tueksi edellyttää erittäin suurten datamäärien keräämistä useista skenaarioista, jotta auto ymmärtäisi, miten vastata oikeasti maailman tilanteisiin. On lukemattomia reunatapauksia, joita voi kohtaata ajaessa, joten algoritmit, jotka ohjaavat näitä ajoneuvoja, tarvitsevat tietokantoja, jotka kattavat kaiken tienpitäjien merkinnät, pysähtymismerkit ja putoavat esineet. Ja kun tätä monistetaan sään tapahtumien määrällä, joka voi esiintyä, koulutusdatan määrä kasvaa eksponentiaalisesti. Autonvalmistajat, jotka siirtyvät autonomisen ajo-tilaan, tarvitsevat luotettavan datavirran, ja sen luominen itse edellyttäisi valtavan määrän resursseja.
Toinen esimerkki on olemassa olevan älypuhelin tuotteen laajentaminen uusiin markkinoihin markkinoiden osuuden ja uusien asiakkaiden saavuttamiseksi. Tämä edellyttää kielen dataa, ja tarkkuuden saavuttamiseksi on kriittistä hankkia puhedatanative puhujilta eri demografisista profiloihin. Kun data on kerätty, puheen tiedostot on transkriboitava kouluttaa tuotteen NLP-algoritmeja. Tämä on erittäin haasteellista yrityksille, jotka tekevät sitä itse, erityisesti jos heillä ei ole sisäistä asiantuntemusta tässä alalla.
Nämä ovat vain kaksi esimerkkiä monista haasteista, jotka liittyvät datan keräämiseen tekoälyyn suuressa mittakaavassa, mutta kuten voit kuvitella, kotiautomaatio, mobiililaitteiden ja biometrisen datan kerääminen kullekin on omat haasteensa.
Mitkä ovat nykyiset tavat, joilla LXT hankkii ja annotoi dataa?
LXT:ssä keräämme ja annotoimme dataa eri tavoin kullekin asiakkaalle, koska kaikki asiakastilamme on räätälöity täyttämään asiakkaiden määrityksiä. Työskentelemme useiden eri datatyyppien parissa, mukaan lukien ääni, kuva, puhe, teksti ja video. Datan keräämisessä työskentelemme globaalin toimijaverkoston kanssa kerätäkseen dataa näissä eri muodoissa. Keräämiset voivat vaihdella datan hankkimisesta todellisissa ympäristöissä, kuten kodeissa, toimistoissa tai autossa, studioon kokemattomien insinöörien kanssa tietynä äänidatan keräämishankkeena.
Datan annotointikapasiteetiemme kattavat myös useita eri muotoja. Kokemuksemme alkoi puhedatassa, ja viimeisen 12 vuoden aikana olemme laajentaneet yli 115 maahan ja yli 750 kielen paikalliseen versioon. Tämä tarkoittaa, että yritykset kaikissa koissa voivat luottaa LXT:hen auttamaan heitä tunkeutumaan laajaan joukkoon markkinoita ja saamaan uusia asiakkaita. Viime aikoina olemme laajentaneet toimintaamme myös tekstiin, kuviin ja videoon, ja sisäinen alustamme toimittaa korkealaatuista dataa asiakkaillemme.
Toinen jännittävä kasvun alue meillä on ollut turvallinen annotointityömme. Tänä vuonna laajensimme ISO 27001 -turvallisen tilan jalanjäljen maailmanlaajuisesti kahdesta viiteen sijaintiin. Olemme kehittäneet pelikirjan, joka mahdollistaa uusien tilojen perustamisen muutamassa kuukaudessa. Palvelut, joihin keskitymme näissä turvallisissa tiloissa, ovat tällä hetkellä puhedatan annotointi ja transkriptio, mutta ne voidaan käyttää useiden eri datatyyppien annotointiin.
Miksi datan hankkiminen tällä tavoin on parempi vaihtoehto kuin synteettinen data?
Synteettinen data on jännittävä kehitys tekoälyalueella ja soveltuu tiettyihin sovelluksiin, erityisesti reunatapauksiin, jotka ovat vaikeita kerätä todellisesta maailmasta. Synteettisen datan käyttö on kasvamassa, erityisesti tekoälyn kypsymisen alkuvaiheessa, kun yritykset ovat vielä kokeiluvaiheessa. Mutta oman tutkimuksemme osoittaa, että kun organisaatiot kypsentävät tekoälystrategioitaan ja siirtävät enemmän malleja tuotantoon, he ovat paljon todennäköisempiä käyttämään valvottuja tai osittain valvottuja koneoppimismenetelmiä, jotka riippuvat inhimillisesti annotoidusta datasta.
Ihmiset ovat yksinkertaisesti parempia kuin tietokoneet ymmärtämään nuansseja luodakseen tarvittavan datan kouluttaa ML-malleja suorittamaan korkealla tarkkuudella, ja inhimillinen valvonta on myös kriittinen vähentämään harhaa.
Miksi tämä data on niin tärkeää puhujille ja luonnollisen kielen prosessoinnille?
Puhujien ja luonnollisen kielen prosessointialgoritmejen toimimiseksi niiden tarkoitetuissa markkinoissa ne tarvitsevat suuria määriä dataa, jotka on kerätty äidinkielisiltä puhujilta, joilla on kulttuurinen konteksti loppukäyttäjille, joita he edustavat. Ilman tätä dataa älypuhelimien omaksuminen on vakavia rajoituksia.
Lisäksi ympäristöön on otettava huomioon kerätessä puhedatan. Jos älypuhelimen ratkaisu, jota koulutetaan, tullaan käyttämään autossa, on tiellä ja sääolosuhteissa vaikutuksia puhumiseen, jotka on otettava huomioon. Nämä ovat monimutkaisia skenaarioita, joissa kokenut datakumppani voi auttaa.
Onko mitään muuta, mitä haluaisit jakaa LXT:stä?
Ensin haluan kiittää sinua mahdollisuudesta jakaa tarinamme! Haluan korostaa, että yrityksemme on omistautunut auttamaan yrityksiä kaikissa koissa menestymään tekoälyhankkeissaan. Olemme keskittyneet toimittamaan erittäin räätälöityä tekoälydataa yrityksille ympäri maailmaa yli 12 vuoden ajan, ja olisimme iloisia yhteydenotosta kenelle tahansa, joka haluaa luoda luotettavan datavirran tekoälyprojektejaan varten.
Kiitos haastattelusta, lukijat, jotka haluavat oppia lisää, voivat vierailla LXT:ssa.












