Intervjuer
Carolyn Harvey, Chief Operations Officer på LXT – Intervju-serie

Carolyn Harvey har omfattande erfarenhet av att leda och växa globala verksamheter inom området söksrelevant rangordning och annotering för ML-data. Carolyn är för närvarande Chief Operations Officer (COO) på LXT, där hon leder företagets globala verksamhetsavdelning och säkerställer att alla AI-dataprogram och -projekt levereras konsekvent. Hon fokuserar på högkvalitativa data i stor skala, bygger effektiviteter i långsiktiga program och skalar över ett stort antal globala lokaler.
Som COO på LXT bidrar Carolyn med sin rika erfarenhet för att utveckla en världsledande organisation.
Kan du kort beskriva vad LXT gör och din roll som COO?
Artificiell intelligens är beroende av data för att existera, och LXT är en framväxande ledare inom tillhandahållande av precisa, etiskt framställda data som driver AI-innovationer. Som Chief Operations Officer är min roll att övervaka, leda och expandera våra globala verksamheter genom strategier, struktur och processer som möjliggör leverans av högkvalitativa AI-data till våra kunder. Jag säkerställer att vi levererar i tid över ett brett spektrum av användningsområden, från generativ AI till söksrelevant och självkörande bilar, bland många andra.
Hur har LXT:s uppdrag utvecklats sedan dess start 2010?
Vårt uppdrag är att driva framtidens teknologier genom datagenerering och -förbättring över alla språk, kulturer och modaliteter. Vårt mål är att hjälpa företag av alla storlekar att utnyttja de otroliga fördelarna som AI erbjuder genom att driva deras modeller med högkvalitativa data. När företagets uppdrag har utvecklats, har vårt tjänsteutbud expanderat från språktranskription och talinsamling till att omfatta en mängd olika lösningar, inklusive datainsamling och annotering för text, bild och video, generativa AI-tjänster och mer. Vi har också expanderat vår globala fotavtryck av ISO 27001-certifierade anläggningar för att möta våra kunders växande behov av säkra data tjänster.
Vilka har varit de viktigaste drivkrafterna för dess tillväxt inom AI-träningsdataområdet?
Fortlöpande investeringar i AI från organisationer av alla storlekar har drivit vår tillväxt. Företag vet nu att AI är en grundförutsättning för att förbli konkurrenskraftiga, och data driver AI. Men inte all data är lika, och företag som lyckas med AI vet att högkvalitativa data är avgörande för att skapa mer precisa AI.
Nu, med generativ AI på alla läppar, har denna trend öppnat ännu fler tillväxtmöjligheter för LXT. Människor är avgörande för att säkerställa att dessa lösningar är precisa, etiska och ansvarsfulla. Vi erbjuder en rad generativa AI-tjänster inom områden som finjustering av stora språkmodeller, promptskapande och mer. Våra kunder vet att för att bygga förtroende hos slutanvändarna behöver utdata från deras generativa AI-produkter vara faktamässiga, representera en mångfaldig publik och vara fria från giftig språk. Vi kan hjälpa dem uppnå dessa mål med våra mänskliga-i-loopen-tjänster.
Hur har explosionen av generativ AI påverkat LXT och dess kunder?
LXT har sett en ökning av efterfrågan på AI-träningsdata på grund av generativ AI, både för kärnorienterad data och nyare aspekter relaterade till analys, kreativitet och kritiskt tänkande. Vi ser också en ökning av efterfrågan på domänkunskap och specialiserade profiler för projektarbetare.
Kundförfrågningar går alltmer bortom mikrouppgifter för maskinlärning till LLM och de mer komplexa datamängder som krävs av appar som ChatGPT, Gemini och många andra avknoppningar. Vi är för närvarande involverade i flera innovativa projekt där vi skriver prompter som syftar till att förvirra den generativa AI för att se hur den svarar, och sedan skapar det korrekta svaret.
I framtiden kan detta utvecklas ytterligare till artificiell allmän intelligens (AGI), där datamängderna kommer att mappa till ännu mer komplicerade och sofistikerade åtgärder.
Du har många års erfarenhet av att arbeta med sökning och personanpassning för att förbättra dessa algoritmer. Vilka är några av de sätt som ledande företag förbättrar sin söksrelevant för att ge en bättre användarupplevelse?
I en värld där tid är dyrbar och information finns överallt, kan förbättrad söksrelevant öka lojalitet, öka konverteringsfrekvenser och göra användare mer produktiva.
Söksrelevant börjar med att rensa och organisera kundens data, rotar ut allt som kan generera falska positiva och skapar ytterligare datafält genom vilka sök- och rekommendationsmotorer kan söka för att generera mer precisa resultat. Med hjälp av maskinlärning och naturlig språkbehandling kan kunderna ge sin sökmotor möjlighet att mer intuitivt avgöra användarens avsikt och lära sig om deras preferenser över tid. Resultatet är en snabbare sökupplevelse som leder till mer personliga resultat.
Att nå detta mål kräver stora mängder träningsdata, med särskild fokus på att lära algoritmerna att känna igen, rangordna och returnera relevanta entiteter, och hur man hanterar stavfel, grammatiska fel och andra dataavvikelser. Vi rekommenderar också en mänsklig-i-loopen-förstärkningsansats för att säkerställa precisa data, minskad bias och ge en bättre sökupplevelse för slutanvändaren. Med ML-utvecklingen under de senaste 10 åren har HITL en intensifierad fokus på kvalitetsgranskningsprocesser, vilket driver ett behov av djupare erfarenhet från dataproducenter.
Kan du utveckla LXT:s tillvägagångssätt för dataannotering och hur man säkerställer kvaliteten och precisionen i AI-träningsdata?
Som en operativ enhet måste vi först förstå hur kunderna använder de data vi tillhandahåller i utvecklingen av sina produkter och tjänster för att säkerställa att det kommer att uppfylla deras behov. För att göra detta behöver vi hitta experter inom både projektledning och annotering som har erfarenhet av den typ av data som krävs.
Sedan handlar det till stor del om förberedelse och att hitta rätt resurser i början av varje projekt. Detta inkluderar att samordna med kunderna på framgångsfaktorer under skedet för planering, samt en djup kvalificerings- och urvalsprocess för projektsannotatorer som beaktar viktiga detaljer som utbildningsbakgrund, specialintressen, demografi och erfarenhet. Vi utvecklar också detaljerade lär- och referensmaterial som en guide, anpassad för varje projekt. Vi tillämpar mogen kvalitets- och processledning i alla projektlivscykler. Tillvägagångssättet vi använder sammanfaller med och informerar branschens bästa praxis, vilket säkerställer att resultaten uppfyller kundernas förväntningar.
Och alla dessa metoder är i tjänst för vårt löfte om garanterad datakvalitet.
Hur hanterar LXT utmaningen att annotera ostrukturerad data, som utgör över 80% av all data?
LXT har byggt en intern annoteringsplattform som automatiserar många delar av annoteringsprocessen och tillhandahåller struktur och en konsekvent användargränssnitt för arbetare. I förbearbetningsstadiet fokuserar vi på förberedelse av data, formatering av indatafiler och borttagning av dubbletter, bland annat, och i efterbearbetning, adresserar vi paketering av data, sammanställning och formatering för leverans till kunden.
Innan projektet startar skapar vi riktlinjer som granskas med kunden och itereras på under hela projektets livscykel när saker förändras. Vi kan bryta ner dataetiketteringsprocessen i flera uppgifter för att fokusera på varje element i projektet ordentligt. Dessutom implementerar vi kvalitetskontrollmetoder för att driva bort fel i stor skala.
Till sist är vårt Operational Excellence Team ansvarigt för avancerad processledning för att säkerställa hög effektivitet och skalbarhet för våra projekt över hela världen.
Vilka är några av de största utmaningarna LXT står inför när det gäller att samla in data i stor skala globalt, och hur övervinner man dem?
Mångfald och bias i deltagare och i de resulterande datainsamlingarna är ofta några av de största utmaningarna som LXT, och varje AI-träningsdatatillhandahållare, kommer att möta. Andra utmaningar inkluderar en nylig efterfrågan på domänexpertis och en snabbt föränderlig landskapsövergång till LLM och generativ AI-data.
Vi övervinner dessa utmaningar genom en proaktiv approach för att identifiera vår kandidatpool, där vi granskar expertis, erfarenhet, tidigare roller, intressen och demografi för att bilda rätt mångfald bland team efter kön eller andra aspekter, såsom analytiskt tänkande eller kreativt skrivande, utbildningsbakgrund, bland annat.
När vi har identifierat rätt kandidater, tar vi stor omsorg om att engagera arbetare regelbundet för att bygga en mer erfaren, lojal och nöjd arbetskraft på lång sikt.
I termer av AI-utvärdering, hur arbetar LXT för att mildra bias och säkerställa etiska utdata i AI-systemen det hjälper till att träna?
Som nämnts tidigare, att säkerställa mångfald är en utmaning som många AI-träningsdatatillhandahållare måste lösa, och det kommer att gå långt för att mildra bias och säkerställa etiska utdata.
Jag hänvisar igen till våra bästa praxis för engagemang, som inkluderar att hitta mångfaldiga och representativa annotatorer och vara noggranna med riktlinjer och kvalitetskontrollåtgärder. Vi har en strategi för påverkanskällning som möjliggör att vi kan ta med arbete till nya och varierade grupper av annotatorer, såsom i långsvansspråkområden.
Vi siktar på etiska utdata genom vår användning av branschens bästa praxis, samordning med kundernas förväntningar och drivande högre standarder för våra projektschefer och annotatorer. Kommunikation är avgörande, liksom regelefterlevnad, biasanalys och ett åtagande till datareglering och sekretesskrav.
Vad är den långsiktiga visionen för LXT och hur ser du att företaget utvecklas under de närmaste fem åren?
Vår vision är att tillhandahålla precisa, etiskt framställda data för att driva utrullningen av AI och de teknologier som kommer att förbättra och förhöja människors upplevelse runt om i världen.
Medan automatisering och teknologi är viktiga i AI, finns det också en viktig mänsklig komponent som kompletterar teknologin. När vi går från enkla automatiserade uppgifter till stora språkmodeller (LLM) och från generativ AI till allmän artificiell intelligens (GAI), kommer det att vara avgörande att AI-produkterna troget representerar människor, både de som genererar data och våra globala samhällen i stort.
Vi strävar efter att säkerställa att AI används på ett positivt och transformerande sätt som reflekterar dessa värderingar.
Tack för det underbara samtalet, läsare som vill lära sig mer kan besöka LXT.












