Rozhovory
Phil Hall, Chief Growth Officer ve společnosti LXT – Interview Series

LXT Chief Growth Officer Phil Hall je bývalý výkonný ředitel společnosti Appen a člen Forbes Technology Council. Ve své vedoucí roli ve společnosti Appen řídil divizi se více než 1 000 zaměstnanci a sehrál klíčovou roli při dosažení 17 po sobě jdoucích let růstu tržeb s konzistentně silnou ziskovostí. Ve své současné roli ve společnosti LXT spolupracuje s pečlivě vybraným týmem odborníků na dosažení ambiciózních růstových cílů.
LXT je rostoucí lídr v oblasti školení umělých inteligencí pro globální organizace, včetně největších technologických společností na světě. Ve spolupráci s mezinárodní sítí přispěvatelů LXT shromažďuje a anotuje data napříč několika modalitami s rychlostí, rozsahem a pružností, kterou vyžadují podniky. Má globální odbornost, která zahrnuje více než 115 zemí a 750 jazykových lokalit. Založena v roce 2010, LXT má sídlo v Torontu, Kanada, a pobočky ve Spojených státech, Austrálii, Egyptě, Spojeném království a Turecku. Společnost obsluhuje zákazníky v Severní Americe, Evropě, Asii a na Blízkém východě.
Kdy jste poprvé objevil, že máte vášeň pro jazyk?
Již od dětství mě fascinuje jazyk, ale co se týče mého přímého zapojení do jazyka a lingvistiky, došlo k jednomu významnému obratu. Brzy jsme si uvědomili, že jedno z našich dětí je dyslektické, a když jsme mluvili se školou o dalších podporách, řekli nám, že zatímco existují programy, které mohou využít, existují také věci, které mohu udělat jako dobrovolník ve škole, abych pomohl naší dceři a dalším dětem. Šlo to dobře a poté jsem začal studovat lingvistiku a nakonec jsem učil na dvou univerzitách v Sydney.
Učili jste lingvistiku, než jste se přesunuli do prostoru mluvených dat, co vás inspirovalo k této změně?
Společnost Appen z Sydney právě přecházela z provozu v jednom pokoji domu na plnohodnotný komerční provoz. Byl jsem informován, že hledají lingvisty (možná přesněji lingvistu!) a byl jsem představen zakladatelům Julii a Chrisovi Vonwillerovým. Přechod byl postupný a trval asi dva roky. Byl jsem váhavý, zda opustit učení – pracovat s vysoce úspěšnými studenty bylo inspirující a hodně zábavy. Ale zejména během těch průkopnických let jsem řešil složité problémy spolu se světovými lídry v oblasti jazykové technologie, a úrovní vzrušení bylo mnoho. Mnoho věcí, které jsou dnes samozřejmé, bylo v té době velmi náročné.
Vyšli jste z důchodu, aby jste se připojili k LXT. Co vás motivovalo k tomuto kroku?
To je zajímavá otázka, protože jsem si действительно užíval důchodu. Ve skutečnosti mě náš spoluzakladatel a CEO Mohammad Omar oslovil měsíce předtím, než jsem odpověděl na jeho počáteční dotaz, protože jsem žil uvolněným životem a neuvažoval o návratu do plného pracovního úvazku. Po dohodě na prvním hovoru, kde Mo zeptal, zda bych se mohl připojit k LXT, jsem očekával, že pouze poslechnu a odmítnu.
Ale nakonec byla příležitost prostě příliš dobrá, aby ji odmítli.
Při hovoru s Mohammadem a dalšími členy týmu LXT jsem okamžitě rozpoznal sdílenou vášeň pro jazyk. Tým, který Mohammad shromáždil, byl plný kreativních myslitelů s neomezenou energií, kteří byli plně oddáni misi společnosti.
Jak jsem se více dozvídal o příležitosti s LXT, uvědomil jsem si, že je to šance, kterou nechci propást. Zde byla společnost s obrovským potenciálem pro expanzi a růst v oblasti, o které jsem vášnivě zajímám. A protože trh s umělými inteligencemi dále roste exponenciálně, je příležitost pomoci více organizacím přejít z experimentování do produkce velmi vzrušující a jsem rád, že jsem součástí.
Jaké jsou některé současné výzvy spojené s získáváním dat ve velkém měřítku?
Výzvy jsou tak rozmanité, jako jsou aplikace, které je pohánějí.
Z praktického hlediska zahrnují výzvy autenticitu, spolehlivost, přesnost, bezpečnost a zajištění, že data jsou vhodné pro účel – a to je bez zohlednění rostoucího počtu právních a etických výzev spojených se získáváním dat.
Například vývoj technologií pro podporu autonomních vozidel vyžaduje sběr extrémně velkých objemů dat napříč mnoha scénáři, aby auto pochopilo, jak reagovat na reálné situace. Existuje nekonečné množství edge případů, se kterými se můžete setkat při řízení, takže algoritmy, které pohánějí tato vozidla, potřebují datové sady, které pokrývají vše od ulic po dopravní značky až po padající objekty. A pokud poté vynásobíte počet povětrnostních podmínek, které mohou nastat, množství trénovacích dat se exponenciálně zvyšuje. Automobilkám, které vstupují do autonomního prostoru, je třeba zřídit spolehlivou datovou pipeline, a udělat to sami by vyžadovalo obrovské množství zdrojů.
Jedním z dalších případů použití je expanze stávajícího produktu hlasové AI do nových trhů, aby se získala tržní podíl a noví zákazníci. To nevyhnutelně vyžaduje jazyková data, a aby se dosáhlo přesnosti, je kritické získat řečová data od rodilých mluvčích napříč různými demografickými profily. Jakmile jsou data shromážděna, je třeba zvukové soubory transkribovat, aby se trénovaly produktovy algoritmy NLP. Dělání toho pro mnoho jazyků a v objemech, které jsou potřebné k efektivity, je extrémně náročné pro společnosti, aby to dělaly samy, zejména pokud postrádají vnitřní odbornost v tomto oboru.
Toto jsou pouze dva příklady mnoha výzev, které existují s ohledem na sběr dat pro umělou inteligenci ve velkém měřítku, ale můžete si představit, že domácí automatizace, mobilní zařízení a biometrická data sbírání mají také své specifické výzvy.
Jaké jsou současné způsoby, kterými LXT získá a anotuje data?
Ve společnosti LXT shromažďujeme a anotujeme data jinak pro každého zákazníka, protože všechny naše zapojení jsou přizpůsobena tak, aby splňovala specifikace našich klientů. Pracujeme napříč různými typy dat, včetně audio, obrazu, řeči, textu a videa. Pro sběr dat spolupracujeme se světovou sítí dodavatelů, aby shromáždili data v těchto různých modalitách. Sbírky mohou zahrnovat získání dat v reálném světě, jako jsou domovy, kanceláře nebo automobily, nebo v ateliéru s zkušenými inženýry v případě určitých projektů sběru řečových dat.
Naše schopnosti anotace dat také pokrývají několik modalit. Naše zkušenosti začaly v oblasti řeči a za posledních 12 let jsme se rozšířili do více než 115 zemí a více než 750 jazykových lokalit. To znamená, že společnosti všech velikostí se mohou spolehnout na LXT, aby jim pomohly proniknout na široké spektrum trhů a získat nové zákaznické segmenty. Nedávno jsme se rozšířili do textu, obrazu a videa, a naše interní platforma se používá k dodání vysoce kvalitních dat našim zákazníkům.
Jedním z dalších zajímavých oblastí růstu pro nás je naše zabezpečená anotace. Letos jsme rozšířili naši stopu zabezpečených zařízení ISO 27001 ze dvou na pět lokalit po celém světě. Vyvinuli jsme playbook, který nám umožňuje zřídit nová zařízení během několika měsíců. Služby, na které se soustředíme v těchto zabezpečených zařízeních, jsou v současné době anotace a transkripce řečových dat, ale mohou být použity pro anotaci napříč mnoha typy dat.
Proč je získávání dat tímto způsobem lepší alternativou k syntetickým datům?
Syntetická data jsou zajímavým vývojem v oblasti umělých inteligencí a jsou vhodné pro specifické použití, zejména pro edge případy, které jsou obtížně zachytitelné ve skutečném světě. Používání syntetických dat roste, zejména v raných fázích zralosti umělých inteligencí, zatímco společnosti jsou stále v experimentálním režimu. Naše vlastní výzkum však ukazuje, že když organizace zralosti svých strategií AI a tlačí více modelů do produkce, jsou mnohem více pravděpodobné, že použijí dohledované nebo polo-dohledované metody strojového učení, které spoléhají na lidsky anotovaná data.
Lidé jsou prostě lepší než počítače v porozumění nuancím, aby vytvořili data potřebná k trénování modelů ML, aby fungovaly s vysokou přesností, a lidský dohled je také kritický pro snížení zkreslení.
Proč jsou tato data tak důležitá pro řeč a zpracování přirozeného jazyka?
Pro algoritmy řeči a zpracování přirozeného jazyka, aby fungovaly efektivně ve svých zamýšlených trzích, potřebují být trénovány s velkými objemy dat shromážděných od rodilých mluvčích, kteří mají kulturní kontext koncových uživatelů, které reprezentují. Bez těchto dat bude adopce hlasové AI mít vážná omezení.
Kromě toho je třeba při sběru řečových dat zohlednit prostředí. Pokud se hlasová AI řešení, která se trénuje, bude používat v autě, jsou zde různé silniční a povětrnostní podmínky, které ovlivňují řeč a je třeba je zohlednit. Tyto jsou komplexní scénáře, kde může zkušený partner s daty pomoci.
Je něco jiného, co byste rádi sdíleli o LXT?
Nejprve bych chtěl poděkovat za příležitost sdílet naši příběh! Rád bych zdůraznil, že naše společnost je odhodlána pomoci organizacím všech velikostí uspět se svými iniciativami AI. Jsme se soustředili na dodávání vysoce přizpůsobených dat AI společnostem po celém světě po dobu více než 12 let a rádi bychom se spojili s kýmkoli, kdo hledá spolehlivou datovou pipeline, aby podpořil své projekty AI.
Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit LXT.












