Interviuri
Carolyn Harvey, Directorul de Operațiuni al LXT – Seria de Interviuri

Carolyn Harvey are o experiență vastă în conducerea și dezvoltarea operațiunilor globale în domeniul relevanței căutării și annotării datelor pentru învățarea mașinilor. Carolyn este în prezent Directorul de Operațiuni (COO) al LXT, unde conduce divizia de operațiuni globale a companiei, asigurând livrarea constantă a tuturor programelor și proiectelor de date AI. Ea se concentrează pe date de înaltă calitate la scară largă, construind eficiențe în programe pe termen lung și extinzându-se la un număr mare de locații globale.
Ca Director de Operațiuni al LXT, Carolyn își aduce experiența vastă pentru a dezvolta o organizație de clasă mondială.
Puteți descrie pe scurt ce face LXT și care este rolul dvs. ca Director de Operațiuni?
Inteligența artificială se bazează pe date pentru a exista, iar LXT este un lider emergent în furnizarea de date precise, etic surse, care alimentează inovațiile AI. Ca Director de Operațiuni, rolul meu este să supraveghez, să conduc și să extind operațiunile noastre globale prin strategii, structuri și procese care ne permit să furnizăm date de înaltă calitate clienților noștri. Mă asigur că livrăm la timp, pe o gamă largă de cazuri de utilizare, de la inteligența generativă la relevanța căutării și mașinile autonome, printre altele.
Cum a evoluat misiunea LXT de la înființarea sa în 2010?
Misiunea noastră este să alimentăm tehnologiile viitorului prin generarea și îmbunătățirea datelor în fiecare limbă, cultură și modalitate. Obiectivul nostru este să ajutăm companiile de toate dimensiunile să capitalizeze pe beneficiile incredibile pe care le oferă inteligența artificială, alimentând modelele lor cu date de înaltă calitate. Pe măsură ce misiunea companiei a evoluat, gama noastră de servicii s-a extins de la transcrierea limbajului și colectarea vorbirii la o gamă largă de soluții, inclusiv colectarea și annotarea datelor pentru text, imagine și video, servicii de inteligență generativă și multe altele. Am extins, de asemenea, amprenta noastră globală de facilități certificate ISO 27001 pentru a satisface nevoile în creștere ale clienților noștri pentru servicii de date securizate.
Care au fost principalii factori ai creșterii sale în sectorul datelor de antrenament AI?
Continua investiție în inteligența artificială din partea organizațiilor de toate dimensiunile a alimentat creșterea noastră. Companiile știu acum că inteligența artificială este esențială pentru a rămâne competitive, iar datele alimentează inteligența artificială. Dar nu toate datele sunt la fel, iar companiile care reușesc în inteligența artificială știu că datele de înaltă calitate sunt critice pentru crearea unor inteligențe artificiale mai precise.
Acum, cu inteligența generativă pe mintea tuturor, această tendință a deschis și mai multe oportunități de creștere pentru LXT. Oamenii sunt esențiali pentru a asigura că aceste soluții sunt precise, etice și responsabile. Noi oferim o gamă de servicii de inteligență generativă în domenii precum finisarea modelelor de limbaj mari, crearea de prompturi și multe altele. Clienții noștri știu că, pentru a construi încredere cu utilizatorii finali, ieșirea produselor lor de inteligență generativă trebuie să fie factuală, să reprezinte o audiență diversă și să fie lipsită de limbaj toxic. Noi putem să-i ajutăm să atingă aceste obiective cu serviciile noastre de tip “om în buclă”.
Cum a afectat explozia inteligenței generative LXT și clienții săi?
LXT a văzut o cerere în creștere pentru datele sale de antrenament AI datorită inteligenței generative, atât pentru datele orientate către limbaj, cât și pentru aspectele mai noi legate de analiză, creativitate și gândire critică. De asemenea, vedem o creștere a cererii pentru cunoștințe de domeniu și profiluri specializate pentru lucrători de proiect.
Cererea clienților se extinde dincolo de intrările de mașini de învățare automate din trecut către modelele de limbaj mari (LLM) și seturile de date mai complexe necesare aplicațiilor precum ChatGPT, Gemini și multe altele. Suntem implicați în mai multe proiecte inovatoare în care scriem prompturi menite să confunde inteligența generativă pentru a vedea cum răspunde și apoi creăm răspunsul corect.
În viitor, acest lucru poate evolua și mai mult către inteligența artificială generală (AGI), unde seturile de date vor corespunde unor acțiuni și mai complicate și sofisticate.
Aveți ani de experiență în domeniul căutării și personalizării pentru a îmbunătăți aceste algoritmi. Care sunt unele dintre modurile în care companiile lider își îmbunătățesc relevanța căutării pentru a oferi o experiență mai bună utilizatorului?
Într-o lume în care timpul este prețios și informația este peste tot, îmbunătățirea relevanței căutării poate consolida loialitatea, poate crește ratele de conversie și poate face utilizatorii mai productivi.
Relevanța căutării începe cu curățarea și organizarea datelor noastre, eliminarea oricărui lucru care ar putea genera rezultate false și crearea unor câmpuri de date suplimentare prin care motoarele de căutare și recomandare pot căuta pentru a genera rezultate mai precise. Cu ajutorul învățării mașinilor și prelucrării limbajului natural, clienții noștri pot împuternici motorul de căutare să intuiască mai bine intenția utilizatorului și să învețe despre preferințele sale în timp. Rezultatul este o experiență de căutare mai rapidă care conduce la rezultate mai personalizate.
Atingerea acestui obiectiv necesită volume mari de date de antrenament, cu un accent special pe antrenarea algoritmilor pentru a recunoaște, a clasifica și a returna entități relevante și pentru a gestiona greșelile de ortografie, erorile gramaticale și alte anomalii de date. De asemenea, recomandăm o abordare de întărire a omului în buclă (HITL) pentru a asigura date precise, a reduce prejudecățile și a oferi o experiență de căutare mai bună pentru utilizatorul final. Cu progresele învățării mașinilor din ultimii 10 ani, HITL are un accent intensificat pe procesele de revizuire a calității, ceea ce conduce la o nevoie mai mare de experiență din partea furnizorilor de date.
Puteți explica abordarea LXT privind annotarea datelor și modul în care asigură calitatea și precizia datelor de antrenament AI?
Ca echipă de operațiuni, trebuie să înțelegem mai întâi cum clienții noștri utilizează datele pe care le furnizăm în dezvoltarea produselor și serviciilor lor pentru a ne asigura că vor corespunde nevoilor lor. Pentru a face acest lucru, trebuie să găsim experți în managementul de proiect și annotare care au experiență cu tipul de date necesar.
De acolo, este vorba în mare parte despre pregătire și găsirea resurselor potrivite la începutul fiecărui proiect. Acest lucru include alinierea cu clienții pe factorii de succes în faza de definire a proiectului, precum și procese de calificare și verificare aprofundate pentru annotatori care iau în considerare detalii importante, cum ar fi background-ul educațional, interesele speciale, demografia și experiența. De asemenea, dezvoltăm materiale de învățare și referință detaliate ca ghid, personalizate pentru fiecare proiect. Aplicăm o supraveghere matură a calității și a procesului de management pe tot parcursul ciclului de viață al proiectului. Abordarea pe care o folosim se aliniază cu și informează cele mai bune practici din industrie, asigurându-se că rezultatele corespund așteptărilor clienților.
Și toate aceste metodologii sunt în slujba promisiunii noastre de calitate a datelor garantate.
Cum gestionează LXT provocarea de a annota datele nestructurate, care reprezintă peste 80% din toate datele?
LXT a construit o platformă de annotare internă care automatizează multe părți ale procesului de annotare și oferă structură și o interfață de utilizator consistentă pentru lucrători. În faza de prelucrare, ne concentrăm pe pregătirea datelor, formatarea fișierelor de intrare și eliminarea duplicatelor, printre altele, iar în faza de post-procesare, ne ocupăm de ambalarea datelor, colectarea și formatarea pentru livrarea către client.
Înainte de a începe proiectul, creăm ghiduri care sunt revizuite cu clientul și iterate pe tot parcursul ciclului de viață al proiectului, pe măsură ce lucrurile se schimbă. Putem descompune procesul de etichetare a datelor în multiple sarcini pentru a ne concentra pe fiecare element al proiectului în mod corespunzător. În plus, implementăm metodologii de control al calității pentru a elimina erorile la scară.
În final, echipa noastră de Excelență Operațională este responsabilă pentru managementul avansat al proceselor pentru a asigura o eficiență ridicată și scalabilitate pentru proiectele noastre din întreaga lume.
Care sunt unele dintre cele mai mari provocări cu care se confruntă LXT în colectarea datelor la scară globală și cum le depășiți?
Diversitatea și prejudecățile în rândul participanților și în colecțiile de date sunt adesea unele dintre cele mai mari provocări cu care se confruntă LXT, și orice furnizor de date de antrenament AI. Alte provocări includ o cerere recentă pentru expertiză de domeniu și un peisaj în schimbare rapidă odată cu trecerea la modelele de limbaj mari și inteligența generativă.
Depășim aceste provocări printr-o abordare proactivă în ceea ce privește sursa noastră de candidați, în care revizuim experiența, experiența anterioară, rolurile anterioare, interesele și demografia pentru a forma diversitatea potrivită în rândul echipelor, după gen sau alte aspecte, cum ar fi gândirea analitică sau scrierea creativă, background-ul educațional, printre altele.
Odată ce am găsit candidații potriviți, ne străduim să implicăm lucrătorii în mod regulat pentru a construi o forță de muncă mai experimentată, mai loială și mai satisfăcută pe termen lung.
În ceea ce privește evaluarea inteligenței artificiale, cum lucrează LXT pentru a mitigă prejudecățile și a asigura ieșiri etice în sistemele AI pe care le ajută să antreneze?
După cum am menționat mai devreme, asigurarea diversității este o provocare pe care mulți furnizori de date de antrenament AI trebuie să o rezolve, și aceasta va merge mult în mitigarea prejudecăților și asigurarea ieșirilor etice.
Mă voi referi din nou la cele mai bune practici de implicare, care includ găsirea de annotatori diversi și reprezentativi și a fi atenți la ghidurile și măsurile de control al calității. Avem o strategie de sursă de impact care ne permite să aducem muncă unor grupuri noi și diverse de annotatori, cum ar fi în regiunile de limbă lungă.
Ne țintim ieșirile etice prin utilizarea celor mai bune practici din industrie, aliniindu-ne pe așteptările clienților noștri și impunând standarde mai ridicate pentru managerii noștri de proiect și annotatori. Comunicarea este esențială, precum și auditurile de conformitate, analiza prejudecăților și angajamentul față de regulile de reglementare și confidențialitate a datelor.
Care este viziunea pe termen lung pentru LXT și cum vedeți evoluția companiei în următorii cinci ani?
Viziunea noastră este să furnizăm date precise, etic surse, pentru a ajuta la lansarea inteligenței artificiale și a tehnologiilor viitorului care vor îmbunătăți și vor îmbogăți experiența oamenilor din întreaga lume.
În timp ce automatizarea și tehnologia sunt importante în inteligența artificială, există și un component uman important care completează tehnologia. Pe măsură ce trecem de la sarcini automate simple la modele de limbaj mari (LLM) și de la inteligența generativă la inteligența artificială generală (GAI), va fi critic să ne asigurăm că produsele de inteligență artificială reprezintă în mod fidel oamenii, atât cei care generează datele, cât și comunitățile noastre globale mai largi.
La LXT, ne străduim să ne asigurăm că inteligența artificială este utilizată într-un mod pozitiv și transformativ care reflectă aceste valori.
Mulțumim pentru acest interviu minunat, cititorii care doresc să afle mai multe despre LXT pot vizita LXT.












