Phỏng vấn
Or Lenchner, Giám đốc điều hành của Bright Data – Loạt phỏng vấn

Or Lenchner, Giám đốc điều hành của Bright Data, đã dẫn dắt nền tảng thu thập dữ liệu web hàng đầu kể từ năm 2018, thúc đẩy sự mở rộng, đổi mới và tăng trưởng lên hơn 100 triệu USD doanh thu hàng năm. Bright Data cho phép các tập đoàn Fortune 500, doanh nghiệp hàng đầu, trường đại học danh tiếng và các tổ chức thuộc lĩnh vực công tiếp cận dữ liệu web công khai theo thời gian thực và quy mô lớn. Lenchner là một người ủng hộ mạnh mẽ việc giữ cho dữ liệu web công khai mở và có thể tiếp cận, nhấn mạnh vai trò quan trọng của nó trong việc thúc đẩy đổi mới.
Điều gì đã truyền cảm hứng cho hành trình của bạn vào thế giới dữ liệu và AI, và kể từ khi trở thành Giám đốc điều hành vào năm 2018, bạn đã định hình nhiệm vụ và tầm nhìn của Bright Data như thế nào?
Tôi luôn bị thu hút bởi sức mạnh của dữ liệu, đặc biệt là cách nó có thể thúc đẩy quyết định và thúc đẩy đổi mới. Khi được sử dụng đúng cách, dữ liệu cũng có thể thúc đẩy tính minh bạch trong kinh doanh. Trở thành Giám đốc điều hành của Bright Data vào năm 2018 đã cho tôi cơ hội giúp định hình cách các nhà nghiên cứu AI và doanh nghiệp thu thập và sử dụng dữ liệu web công khai.
Những thách thức chính mà các nhóm AI phải đối mặt khi thu thập dữ liệu web công khai quy mô lớn là gì, và Bright Data giải quyết chúng như thế nào?
Khả năng mở rộng vẫn là một trong những thách thức lớn nhất cho các nhóm AI. Vì các mô hình AI yêu cầu lượng lớn dữ liệu, việc thu thập hiệu quả không phải là một nhiệm vụ nhỏ. Và vì các mô hình AI chỉ tốt như dữ liệu chúng được đào tạo, việc đảm bảo các nhóm có quyền truy cập vào dữ liệu mới, chất lượng cao là một thách thức liên tục. Điều này đặc biệt đúng khi web đang phát triển theo thời gian thực.
Một mối quan tâm lớn khác là tuân thủ. Luật bảo vệ dữ liệu và các yêu cầu liên tục thay đổi, vì vậy các nhóm AI cần phải luôn cập nhật những thay đổi này. Họ cũng cần phải hiểu cách đối phó với các trang web áp dụng các cơ chế chống bot, điều này có thể làm phức tạp quá trình thu thập dữ liệu.
Nền tảng mà chúng tôi đã xây dựng tại Bright Data giải quyết những thách thức này. Chúng tôi cung cấp thu thập dữ liệu tự động, có thể mở rộng, cung cấp dữ liệu thời gian thực đã được cấu trúc. Các công cụ AI của chúng tôi làm sạch và xác thực dữ liệu để đảm bảo độ chính xác. Chúng tôi có các biện pháp nghiêm ngặt để đảm bảo thu thập dữ liệu hợp pháp và đạo đức cho tuân thủ. Ý tưởng là để các nhóm AI tập trung vào xây dựng các mô hình tuyệt vời, trong khi chúng tôi xử lý các phức tạp của việc thu thập dữ liệu.
Dữ liệu web chất lượng cao đóng góp như thế nào vào hiệu suất của mô hình AI, và những phương pháp hay nhất để đảm bảo độ chính xác của dữ liệu là gì?
Dữ liệu chất lượng cao có nghĩa là dữ liệu hoàn chỉnh, không bị thiên vị và quan trọng nhất, chính xác. Nếu dữ liệu thiếu hoặc bị ảnh hưởng bởi các sai sót và sai lầm, mô hình AI kết quả sẽ không hoạt động theo dự kiến.
Để đạt được độ chính xác, tốt nhất là thu thập dữ liệu từ nhiều nguồn công khai đã được chứng minh là đáng tin cậy. Chỉ sử dụng một hoặc hai nguồn, hoặc tồi tệ hơn, một nguồn duy nhất, sẽ dẫn đến các vấn đề như không đầy đủ. Việc có nhiều nguồn cung cấp khả năng tham chiếu chéo dữ liệu và xây dựng một tập dữ liệu cân bằng và đại diện hơn. Ngoài ra, các tổ chức nên xem xét việc xác thực và làm sạch dữ liệu tự động để loại bỏ hiệu quả dữ liệu sai và không nhất quán.
Tại Bright Data, chúng tôi tính đến tất cả những yếu tố này. Chúng tôi cung cấp cho các nhóm AI dữ liệu đã được cấu trúc và xác thực về độ chính xác. Điều đó cho phép họ đào tạo mô hình với sự tự tin.
Những lo ngại về đạo đức lớn nhất trong việc thu thập dữ liệu web công khai hiện nay là gì?
Riêng tư vẫn là một trong những mối quan tâm lớn nhất trong việc thu thập dữ liệu web công khai. Người dân lo lắng về việc dữ liệu của họ bị lộ và lạm dụng. Để đảm bảo rằng dữ liệu vẫn riêng tư, điều quan trọng là phải nhấn mạnh tính minh bạch. Các tổ chức thu thập dữ liệu phải minh bạch về dữ liệu họ thu thập. Điều quan trọng là phải đảm bảo với công chúng rằng dữ liệu của họ được sử dụng theo các hướng dẫn đạo đức nghiêm ngặt.
Một mối quan tâm lớn khác là sự tập trung hóa. Một số công ty lớn có quyền kiểm soát lượng lớn dữ liệu, tạo ra một sân chơi không đồng đều, nơi chỉ một số ít có quyền truy cập vào thông tin cần thiết để đào tạo mô hình AI và thúc đẩy đổi mới. Điều này không phải là cách mọi thứ nên được thực hiện. Dữ liệu web công khai nên vẫn có thể tiếp cận được với các doanh nghiệp, nhà nghiên cứu và nhà phát triển. Điều đó cho phép phát triển AI không tập trung vào tay một số ít người chơi lớn.
Đạo đức không phải là một suy nghĩ sau cùng tại Bright Data. Đó là điều được tích hợp vào mọi quyết định chúng tôi đưa ra. Chúng tôi không chỉ tuân theo các tiêu chuẩn của ngành – chúng tôi thiết lập chúng. Chúng tôi dẫn đầu trong ngành thu thập dữ liệu trong việc xác định các tiêu chuẩn đạo đức đúng. Chúng tôi muốn đảm bảo rằng dữ liệu web công khai được truy cập một cách có trách nhiệm, minh bạch và tuân thủ các quy định toàn cầu.
Bright Data đảm bảo tuân thủ các quy định bảo vệ dữ liệu toàn cầu như thế nào trong khi vẫn cho phép thu thập dữ liệu quy mô lớn?
Tổ chức của chúng tôi cam kết tuân thủ các yêu cầu pháp lý và quy định toàn cầu về thu thập và sử dụng dữ liệu. Chúng tôi đảm bảo rằng chúng tôi tuân thủ các yêu cầu của GDPR, CPRA, CCPA và các quy định khác có liên quan. Quan trọng hơn, chúng tôi tuân thủ nghiêm ngặt các giao thức Know Your Customer (KYC) để đảm bảo rằng chỉ những người dùng hợp pháp mới có thể truy cập vào nền tảng của chúng tôi. Các giải pháp dữ liệu của chúng tôi chỉ có thể được truy cập bởi các doanh nghiệp và nhà nghiên cứu hợp pháp.
Chính sách Sử dụng được chấp nhận của chúng tôi cũng rõ ràng trong việc xác định những gì có thể và không thể thu thập. Điều này bao gồm việc sử dụng có trách nhiệm. Chúng tôi có một đội ngũ tuân thủ chuyên trách chịu trách nhiệm giám sát liên tục các quy định để đảm bảo rằng chúng tôi luôn cập nhật với các yêu cầu pháp lý và quy định mới nhất.
Dù vậy, chúng tôi vẫn tin rằng dữ liệu web công khai nên vẫn có thể tiếp cận được. Mục tiêu của chúng tôi là cung cấp cho các nhóm AI dữ liệu họ cần trong khi vẫn đảm bảo tuân thủ các tiêu chuẩn về quyền riêng tư và pháp lý.
Bạn cân bằng tăng trưởng kinh doanh với việc duy trì các phương pháp thu thập dữ liệu đạo đức như thế nào?
Chúng tôi luôn coi đạo đức và tăng trưởng là không loại trừ lẫn nhau. Niềm tin của khách hàng và mối quan hệ chúng tôi xây dựng với họ là những mối quan tâm hàng đầu. Chúng tôi hiểu rằng chúng tôi chỉ có thể đạt được thành công lâu dài nếu chúng tôi thu thập dữ liệu theo các điều khoản minh bạch và tuân thủ các luật áp dụng.
Do đó, chúng tôi đã thiết lập một giao thức kiểm tra nghiêm ngặt cho người dùng của chúng tôi. Điều này được thiết kế để đảm bảo rằng dữ liệu chúng tôi thu thập được sử dụng một cách đạo đức. Chúng tôi dành thời gian, công sức và tài nguyên cho việc tuân thủ và bảo mật để bảo vệ khách hàng và công chúng nói chung. Bằng cách tuân theo các phương pháp thu thập dữ liệu đạo đức, chúng tôi thành công trong kinh doanh trong khi góp phần xây dựng một hệ sinh thái AI minh bạch và có trách nhiệm.
Bright Data duy trì sự lãnh đạo trước các thay đổi về quy định trong bảo vệ dữ liệu như thế nào?
Chúng tôi hiểu rằng các quy trình và chính sách sử dụng dữ liệu của chúng tôi cuối cùng sẽ phải thay đổi để phản ánh các thay đổi trong luật và quy định. Do đó, chúng tôi thường xuyên tham khảo ý kiến của các chuyên gia pháp lý và giao tiếp với các cơ quan quản lý. Chúng tôi cũng tham gia vào các cuộc thảo luận với các nhà lập pháp và những người khác tham gia vào việc xây dựng chính sách, cung cấp đầu vào trong việc tạo ra các quy định bảo vệ dữ liệu có ý nghĩa. Chúng tôi nhằm mục đích tìm kiếm sự cân bằng giữa đổi mới và bảo vệ dữ liệu.
Khung khổ thu thập và sử dụng dữ liệu của chúng tôi phát triển khi các luật mới được ban hành và các quy định được sửa đổi. Chúng tôi có một đội ngũ tuân thủ chủ động cập nhật các chính sách sử dụng dữ liệu của chúng tôi để đảm bảo rằng nền tảng của chúng tôi luôn tuân thủ đầy đủ. Hơn nữa, chúng tôi vận hành các sáng kiến giáo dục khách hàng để thúc đẩy việc sử dụng dữ liệu có trách nhiệm.
Các xu hướng mới nổi trong thu thập dữ liệu AI mà các công ty nên biết là gì?
Thu thập dữ liệu theo thời gian thực đang trở thành một yêu cầu thiết yếu cho các mô hình AI hiện đại. Điều quan trọng là chúng phải có quyền truy cập vào dữ liệu mới nhất hoặc mới nhất để cung cấp mức độ chính xác cao và mang lại trải nghiệm người dùng tốt hơn.
Một xu hướng đáng chú ý khác là sự phụ thuộc vào dữ liệu tổng hợp được sử dụng cho tăng cường dữ liệu, nơi AI tạo ra dữ liệu bổ sung cho các tập dữ liệu thu thập từ các kịch bản thế giới thực.
Tôi cũng thấy sự quan tâm mạnh mẽ đến việc theo đuổi AI có thể giải thích được. Hầu hết các mô hình AI hiện tại đều bị ảnh hưởng bởi hiệu ứng hộp đen, hoặc thiếu minh bạch trong các quy trình ra quyết định của chúng. Các công ty đang tìm cách thay đổi mô hình này bằng cách tạo ra các mô hình AI có thể giải thích cách chúng đạt được đầu ra hoặc quyết định mà chúng đưa ra.
Cuối cùng, các công ty nhận thức được ngày càng nhiều về các vấn đề bảo vệ dữ liệu. Đó là lý do tại sao các kỹ thuật AI nhằm bảo tồn bảo vệ dữ liệu, chẳng hạn như học tập liên bang, đang trở nên thịnh hành. Các tổ chức muốn tối đa hóa việc đào tạo mô hình AI mà không có sự thỏa hiệp về quyền riêng tư của người dùng.
Chúng tôi đảm bảo rằng chúng tôi luôn cập nhật với những xu hướng này để chúng tôi có thể xây dựng các giải pháp cho phép các nhóm AI duy trì lợi thế cạnh tranh.
Bạn nhìn thấy các đại lý và tự động hóa được hỗ trợ bởi AI thay đổi cảnh quan thu thập dữ liệu như thế nào?
Hiện tại, các mô hình AI sử dụng các tập dữ liệu đã được cấu trúc chủ yếu được thu thập thủ công. Các tập dữ liệu này cũng đi qua các bước tiền xử lý, làm sạch và các thủ tục khác thường liên quan đến sự can thiệp của con người. Điều này sẽ thay đổi trong tương lai gần với sự xuất hiện của các đại lý AI cho việc thu thập và xử lý dữ liệu tự động cho đào tạo AI. Chúng cho phép học hỏi tự động từ dữ liệu web thời gian thực với quy mô chưa từng có.
Chúng tôi đã tạo ra cơ sở hạ tầng hỗ trợ việc triển khai và phát triển các đại lý AI, cho phép truy cập mượt mà vào dữ liệu web chất lượng cao theo thời gian thực. Công nghệ này cho phép các hệ thống AI tinh vi giao tiếp liên tục với dữ liệu web động, học hỏi từ nó và phát triển lớn hơn và tốt hơn.
Các đại lý AI có thể biến đổi các ngành công nghiệp vì chúng cho phép các hệ thống AI truy cập và học hỏi từ các tập dữ liệu luôn thay đổi trên web thay vì dựa vào dữ liệu tĩnh và được xử lý thủ công. Điều này có thể dẫn đến các rô-bốt trò chuyện AI trong lĩnh vực ngân hàng hoặc an ninh mạng, ví dụ, có khả năng đưa ra quyết định phản ánh hiện thực mới nhất. Điều này dẫn đến những tiến bộ lớn về hiệu quả và nhiều lĩnh vực tự động hóa hơn.
Tại Bright Data, chúng tôi không chỉ cho phép sự chuyển đổi này trong cảnh quan thu thập dữ liệu. Chúng tôi tin rằng chúng tôi đang ở vị trí hàng đầu, giới thiệu một công nghệ mở ra thế hệ tiếp theo của trí tuệ nhân tạo. Chúng tôi rất hào hứng được hỗ trợ các doanh nghiệp và nhóm AI khi họ tận dụng toàn bộ tiềm năng của các đại lý AI cho hoạt động của họ.
Cảm ơn cuộc phỏng vấn tuyệt vời, những người đọc muốn tìm hiểu thêm có thể truy cập Bright Data.












