Phỏng vấn
Carolyn Harvey, Giám đốc vận hành tại LXT – Phỏng vấn loạt

Carolyn Harvey có kinh nghiệm rộng rãi trong việc lãnh đạo và phát triển các hoạt động toàn cầu trong lĩnh vực tìm kiếm liên quan và chú thích dữ liệu cho máy học. Carolyn hiện là Giám đốc vận hành (COO) của LXT nơi cô lãnh đạo bộ phận vận hành toàn cầu của công ty, đảm bảo việc giao hàng nhất quán tất cả các chương trình và dự án dữ liệu AI. Cô tập trung vào dữ liệu chất lượng cao với quy mô lớn, xây dựng hiệu quả trong các chương trình dài hạn và mở rộng trên số lượng lớn các khu vực toàn cầu.
Với tư cách là COO của LXT, Carolyn mang lại kinh nghiệm phong phú của mình để phát triển một tổ chức hàng đầu.
Bạn có thể mô tả ngắn gọn về LXT và vai trò của bạn với tư cách là COO?
Trí tuệ nhân tạo phụ thuộc vào dữ liệu để tồn tại, và LXT là một trong những công ty dẫn đầu trong việc cung cấp dữ liệu chính xác, được thu thập một cách đạo đức, giúp thúc đẩy các đổi mới AI. Với tư cách là Giám đốc vận hành, vai trò của tôi là giám sát, lãnh đạo và mở rộng các hoạt động toàn cầu của chúng tôi thông qua các chiến lược, cấu trúc và quy trình cho phép chúng tôi cung cấp dữ liệu AI chất lượng cao nhất cho khách hàng của mình. Tôi đảm bảo chúng tôi giao hàng đúng thời hạn trên một loạt các trường hợp sử dụng, từ AI tạo sinh đến tìm kiếm liên quan và xe tự lái, trong số nhiều trường hợp khác.
LXT đã thay đổi như thế nào kể từ khi thành lập vào năm 2010?
Sứ mệnh của chúng tôi là cung cấp năng lượng cho các công nghệ của tương lai thông qua việc tạo ra và cải thiện dữ liệu trên mọi ngôn ngữ, văn hóa và phương thức. Mục tiêu của chúng tôi là giúp các công ty thuộc mọi quy mô tận dụng lợi ích tuyệt vời mà AI mang lại bằng cách cung cấp cho họ dữ liệu chất lượng cao. Khi sứ mệnh của công ty chúng tôi phát triển, phạm vi dịch vụ của chúng tôi đã mở rộng từ phiên dịch ngôn ngữ và thu thập giọng nói để bao gồm một loạt các giải pháp, bao gồm thu thập và chú thích dữ liệu cho văn bản, hình ảnh và video, dịch vụ AI tạo sinh và nhiều hơn nữa. Chúng tôi cũng đã mở rộng cơ sở toàn cầu của các cơ sở được chứng nhận ISO 27001 để đáp ứng nhu cầu ngày càng tăng của khách hàng về dịch vụ dữ liệu an toàn.
Điều gì đã thúc đẩy sự tăng trưởng của LXT trong lĩnh vực dữ liệu đào tạo AI?
Đầu tư liên tục vào AI từ các tổ chức thuộc mọi quy mô đã thúc đẩy sự tăng trưởng của chúng tôi. Các công ty hiện nay biết rằng AI là một yếu tố quan trọng để họ duy trì khả năng cạnh tranh, và dữ liệu cung cấp năng lượng cho AI. Nhưng không phải tất cả dữ liệu đều như nhau, và các công ty thành công trong AI biết rằng dữ liệu chất lượng cao là rất quan trọng để tạo ra AI chính xác hơn.
Bây giờ với AI tạo sinh trên mọi người, xu hướng này đã mở ra nhiều cơ hội tăng trưởng hơn cho LXT. Con người rất quan trọng để đảm bảo rằng những giải pháp này chính xác, đạo đức và có trách nhiệm. Chúng tôi cung cấp một loạt các dịch vụ AI tạo sinh trong các lĩnh vực như tinh chỉnh mô hình ngôn ngữ lớn, tạo lời nhắc và nhiều hơn nữa. Khách hàng của chúng tôi biết rằng để xây dựng niềm tin với người dùng cuối, đầu ra của sản phẩm AI tạo sinh của họ cần phải chính xác, đại diện cho một khán giả đa dạng và không chứa ngôn ngữ độc hại. Chúng tôi có thể giúp họ đạt được những mục tiêu này với các dịch vụ của con người trong vòng lặp.
Việt Nam đã ảnh hưởng đến LXT và khách hàng của họ như thế nào?
LXT đã chứng kiến sự gia tăng nhu cầu về dữ liệu đào tạo AI do AI tạo sinh, cả về dữ liệu ngôn ngữ cốt lõi và các khía cạnh mới liên quan đến phân tích, sáng tạo và tư duy phản biện. Chúng tôi cũng đang chứng kiến sự gia tăng nhu cầu về kiến thức lĩnh vực và hồ sơ chuyên môn cho công nhân dự án.
Yêu cầu của khách hàng đang ngày càng vượt ra ngoài việc nhập dữ liệu máy học vi mô trong quá khứ và chuyển sang các mô hình ngôn ngữ lớn (LLM), và các tập dữ liệu phức tạp hơn được yêu cầu bởi các ứng dụng như ChatGPT, Gemini và nhiều nhánh khác. Hiện tại, chúng tôi đang tham gia vào một số dự án sáng tạo nơi chúng tôi viết lời nhắc nhằm mục đích làm cho AI tạo sinh bối rối và xem nó phản ứng như thế nào, sau đó tạo ra câu trả lời chính xác.
Trong tương lai, điều này có thể phát triển thêm thành trí tuệ nhân tạo tổng quát (AGI) nơi các tập dữ liệu sẽ ánh xạ đến các hành động phức tạp và tinh vi hơn.
Bạn đã có nhiều năm kinh nghiệm làm việc trong tìm kiếm và cá nhân hóa để cải thiện các thuật toán này. Một số cách mà các công ty hàng đầu đang cải thiện tính liên quan của tìm kiếm để cung cấp trải nghiệm người dùng tốt hơn là gì?
Trong một thế giới nơi thời gian rất quý giá và thông tin ở mọi nơi, việc cải thiện tính liên quan của tìm kiếm có thể tăng cường lòng trung thành, tăng tỷ lệ chuyển đổi và làm cho người dùng trở nên năng suất hơn.
Tính liên quan của tìm kiếm bắt đầu với việc làm sạch và tổ chức dữ liệu của khách hàng, loại bỏ mọi thứ có thể tạo ra kết quả dương tính giả, và tạo ra các trường dữ liệu bổ sung mà các công cụ tìm kiếm và đề xuất có thể tìm kiếm để tạo ra kết quả chính xác hơn. Với sự giúp đỡ của máy học và xử lý ngôn ngữ tự nhiên, khách hàng có thể trao quyền cho công cụ tìm kiếm của họ để trực giác hơn về ý định của người dùng và học hỏi về sở thích của họ theo thời gian. Kết quả là một trải nghiệm tìm kiếm nhanh hơn dẫn đến kết quả được cá nhân hóa hơn.
Để đạt được mục tiêu này, cần có một lượng lớn dữ liệu đào tạo, với sự tập trung đặc biệt vào việc đào tạo các thuật toán để nhận ra, xếp hạng và trả về các thực thể liên quan, cũng như cách xử lý lỗi đánh máy, lỗi ngữ pháp và các bất thường dữ liệu khác. Chúng tôi cũng khuyên bạn nên sử dụng một phương pháp tăng cường lặp lại của con người (HITL) để đảm bảo dữ liệu chính xác, giảm thiểu thiên vị và cung cấp trải nghiệm tìm kiếm tốt hơn cho người dùng cuối. Với sự tiến bộ của máy học trong 10 năm qua, HITL đã tập trung nhiều hơn vào các quy trình kiểm tra chất lượng sâu sắc hơn, điều này thúc đẩy nhu cầu về kinh nghiệm sâu sắc hơn từ các nhà cung cấp dữ liệu.
Bạn có thể giải thích phương pháp tiếp cận của LXT đối với chú thích dữ liệu và cách đảm bảo chất lượng và độ chính xác của dữ liệu đào tạo AI?
Với tư cách là một nhóm vận hành, chúng tôi phải hiểu trước cách khách hàng sử dụng dữ liệu mà chúng tôi cung cấp trong việc phát triển sản phẩm và dịch vụ của họ để đảm bảo rằng nó sẽ đáp ứng nhu cầu của họ. Để làm điều này, chúng tôi cần tìm các chuyên gia trong cả quản lý dự án và chú thích có kinh nghiệm với loại dữ liệu được yêu cầu.
Từ đó, nó chủ yếu là về việc chuẩn bị và tìm đúng nguồn lực tại bắt đầu của mỗi dự án. Điều này bao gồm việc sắp xếp với khách hàng về các yếu tố thành công trong giai đoạn lập kế hoạch cũng như các quy trình đủ điều kiện và sàng lọc sâu sắc cho các chú thích viên dự án, xem xét các chi tiết quan trọng như nền tảng giáo dục, sở thích đặc biệt, dân tộc và kinh nghiệm. Chúng tôi cũng phát triển các tài liệu học tập và tham khảo chi tiết làm hướng dẫn, được tùy chỉnh cho từng dự án. Chúng tôi áp dụng quản lý chất lượng và quy trình trưởng thành trong suốt tất cả các chu kỳ dự án. Phương pháp tiếp cận mà chúng tôi sử dụng phù hợp với và thông báo các phương pháp hay nhất trong ngành, đảm bảo kết quả đáp ứng được kỳ vọng của khách hàng.
Và tất cả các phương pháp này đều phục vụ cho lời hứa về chất lượng dữ liệu được đảm bảo của chúng tôi.
LXT xử lý thách thức của việc chú thích dữ liệu không cấu trúc, chiếm hơn 80% tất cả dữ liệu, như thế nào?
LXT đã xây dựng một nền tảng chú thích nội bộ tự động hóa nhiều phần của quá trình chú thích và cung cấp cấu trúc và giao diện người dùng nhất quán cho người lao động. Trong giai đoạn tiền xử lý, chúng tôi tập trung vào việc chuẩn bị dữ liệu, định dạng tệp đầu vào và loại bỏ bản sao, trong số các việc khác, và trong giai đoạn hậu xử lý, giải quyết việc đóng gói dữ liệu, thu thập và định dạng để giao hàng cho khách hàng.
Trước khi dự án bắt đầu, chúng tôi tạo ra các hướng dẫn được xem xét lại với khách hàng và lặp lại trong suốt chu kỳ dự án khi mọi thứ thay đổi. Chúng tôi có thể chia nhỏ quá trình gắn nhãn dữ liệu thành nhiều nhiệm vụ để tập trung vào từng yếu tố của dự án một cách chính xác. Ngoài ra, các phương pháp kiểm soát chất lượng được thực hiện để loại bỏ lỗi ở quy mô lớn.
Cuối cùng, Đội ngũ Excellence Operational của chúng tôi chịu trách nhiệm về quản lý quy trình tiên tiến để đảm bảo hiệu quả cao và khả năng mở rộng cho các dự án của chúng tôi trên toàn thế giới.
Một số thách thức lớn nhất mà LXT phải đối mặt khi thu thập dữ liệu ở quy mô toàn cầu là gì và bạn vượt qua chúng như thế nào?
Sự đa dạng và thiên vị trong các tham gia và trong các bộ sưu tập dữ liệu thường là một số thách thức lớn nhất mà LXT, và bất kỳ nhà cung cấp dữ liệu đào tạo AI nào, sẽ phải đối mặt. Các thách thức khác bao gồm nhu cầu gần đây về chuyên môn lĩnh vực và một phong cảnh thay đổi nhanh chóng với sự chuyển đổi sang LLM và dữ liệu AI tạo sinh.
Chúng tôi vượt qua những thách thức này thông qua một cách tiếp cận chủ động cao trong việc tìm kiếm nhóm ứng viên của chúng tôi, nơi chúng tôi xem xét chuyên môn, kinh nghiệm, vai trò trước đây, sở thích và dân tộc để tạo ra sự đa dạng đúng đắn trong các nhóm theo giới tính hoặc các khía cạnh khác, chẳng hạn như tư duy phân tích hoặc viết sáng tạo, nền tảng giáo dục, trong số các yếu tố khác.
Khi chúng tôi đã tìm được đúng ứng viên, chúng tôi dành nhiều sự quan tâm để tham gia người lao động thường xuyên để xây dựng một lực lượng lao động có kinh nghiệm, trung thành và hài lòng hơn trong dài hạn.
Về việc đánh giá AI, LXT làm việc như thế nào để giảm thiểu thiên vị và đảm bảo đầu ra đạo đức trong các hệ thống AI mà họ giúp đào tạo?
Como đã đề cập trước đó, việc đảm bảo sự đa dạng là một thách thức mà nhiều nhà cung cấp dữ liệu đào tạo AI phải giải quyết, và điều đó sẽ đi một chặng đường dài trong việc giảm thiểu thiên vị và đảm bảo đầu ra đạo đức.
Tôi sẽ đề cập lại đến các phương pháp hay nhất về tham gia của chúng tôi, bao gồm việc tìm kiếm các chú thích viên đa dạng và đại diện, cũng như được xem xét kỹ lưỡng về các hướng dẫn và biện pháp kiểm soát chất lượng. Chúng tôi có một chiến lược nguồn tác động cho phép chúng tôi mang công việc đến các nhóm mới và đa dạng của các chú thích viên, chẳng hạn như trong các khu vực ngôn ngữ dài.
Chúng tôi nhắm đến các đầu ra đạo đức thông qua việc sử dụng các phương pháp hay nhất trong ngành, sắp xếp với khách hàng về kỳ vọng và thúc đẩy các tiêu chuẩn cao hơn cho các nhà quản lý dự án và chú thích viên của chúng tôi. Truyền thông là rất quan trọng cũng như các cuộc kiểm tra tuân thủ, phân tích thiên vị và cam kết về các yêu cầu quy định và bảo mật dữ liệu.
Tầm nhìn dài hạn cho LXT là gì và bạn thấy công ty sẽ phát triển như thế nào trong năm năm tới?
Tầm nhìn của chúng tôi là cung cấp dữ liệu chính xác, được thu thập một cách đạo đức, để giúp thúc đẩy việc triển khai AI và các công nghệ của tương lai sẽ cải thiện và nâng cao trải nghiệm của mọi người trên toàn thế giới.
Mặc dù tự động hóa và công nghệ rất quan trọng trong AI, nhưng cũng có một thành phần quan trọng của con người bổ sung cho công nghệ. Khi chúng tôi chuyển từ các nhiệm vụ tự động hóa đơn giản sang các mô hình ngôn ngữ lớn (LLM) và từ AI tạo sinh sang trí tuệ nhân tạo tổng quát (GAI), điều quan trọng là các sản phẩm AI phải trung thực đại diện cho con người, cả những người tạo ra dữ liệu và các cộng đồng toàn cầu của chúng tôi.
Ở LXT, chúng tôi phấn đấu để đảm bảo rằng AI được sử dụng theo cách tích cực và chuyển đổi mà phản ánh những giá trị này.
Cảm ơn vì cuộc phỏng vấn tuyệt vời, những người đọc muốn tìm hiểu thêm có thể truy cập LXT.












