Phỏng vấn
Amy Steier, Nhà khoa học máy học chính tại Gretel.ai – Loạt phỏng vấn

Amy Steier là Nhà khoa học máy học chính tại Gretel.ai, nền tảng kỹ thuật bảo mật riêng tư tiên tiến nhất thế giới. Gretel giúp dễ dàng tích hợp bảo mật vào thiết kế của công nghệ dữ liệu. Các thư viện mã nguồn mở dựa trên AI của nó được thiết kế để biến đổi, ẩn danh và tổng hợp thông tin nhạy cảm.
Amy là một nhà khoa học máy học và khoa học dữ liệu rất thành công với hơn 20 năm kinh nghiệm. Đam mê của cô là dữ liệu lớn và tìm ra trí tuệ ẩn trong đó bằng cách sử dụng các kỹ thuật từ máy học, khai thác dữ liệu, trí tuệ nhân tạo và thống kê. Cô có kỹ năng cao trong mô hình dự đoán, phân loại, phân cụm, phát hiện bất thường, trực quan hóa dữ liệu, phương pháp tổng hợp, thu hồi thông tin, phân tích an ninh mạng, NLP, mô hình khuyến nghị và phân tích hành vi người dùng.
Điều gì đã thu hút bạn theo đuổi sự nghiệp trong lĩnh vực khoa học máy tính và máy học?
Tình yêu tuyệt đối, không che giấu, và lâu dài của tôi dành cho dữ liệu. Quyền lực, bí ẩn, hấp dẫn và tiềm năng của dữ liệu luôn khiến tôi着迷. Khoa học máy tính và máy học là những công cụ để khai thác tiềm năng đó. Ngoài ra, rất thú vị khi làm việc trong một lĩnh vực mà trạng thái nghệ thuật tiến bộ rất nhanh. Tôi yêu thích sự giao nhau giữa nghiên cứu và sản phẩm. Rất hài lòng khi đưa những ý tưởng tiên tiến, đẩy chúng một chút xa hơn, và sau đó biến chúng thành phù hợp với nhu cầu sản phẩm hiện có.
Đối với những người đọc chưa quen thuộc, bạn có thể giải thích dữ liệu tổng hợp là gì không?
Dữ liệu tổng hợp là dữ liệu trông và hoạt động giống như dữ liệu gốc nhưng cũng đủ khác để đáp ứng một số trường hợp sử dụng. Trường hợp sử dụng phổ biến nhất là nhu cầu bảo vệ sự riêng tư của thông tin trong dữ liệu gốc. Một trường hợp sử dụng khác là cần tạo thêm dữ liệu để tăng kích thước của tập dữ liệu gốc. Một trường hợp sử dụng khác là giúp giải quyết sự mất cân bằng lớp hoặc có thể sự thiên vị dân số trong tập dữ liệu gốc.
Dữ liệu tổng hợp cho phép chúng tôi tiếp tục phát triển các sản phẩm và giải pháp mới và sáng tạo khi dữ liệu cần thiết để làm như vậy khác không có sẵn.
Làm thế nào nền tảng Gretel hoạt động để tạo dữ liệu tổng hợp thông qua API?
API kỹ thuật bảo mật riêng tư của Gretel cho phép bạn nhập dữ liệu vào Gretel và khám phá dữ liệu mà chúng tôi có thể trích xuất. Đây là những API được sử dụng bởi Console của chúng tôi. Bằng cách暴露 các API, thông qua giao diện trực quan, chúng tôi hy vọng sẽ trao quyền cho các nhà phát triển và nhà khoa học dữ liệu xây dựng các quy trình làm việc của riêng họ xung quanh Gretel.
Trong khi Console làm cho việc tạo dữ liệu tổng hợp rất dễ dàng, các API cho phép bạn tích hợp việc tạo dữ liệu tổng hợp vào quy trình làm việc của bạn. Tôi yêu thích sử dụng các API vì nó cho phép tôi tùy chỉnh việc tạo dữ liệu tổng hợp cho một trường hợp sử dụng rất cụ thể.
Bạn có thể thảo luận về một số công cụ được cung cấp bởi Gretel để giúp đánh giá chất lượng của dữ liệu tổng hợp không?
Sau khi tạo dữ liệu tổng hợp, Gretel sẽ tạo một Báo cáo Tổng hợp. Trong báo cáo này, bạn có thể xem Điểm chất lượng dữ liệu tổng hợp (SQS), cũng như mức độ bảo vệ riêng tư (PPL).
Điểm SQS là một ước tính về việc dữ liệu tổng hợp tạo ra có duy trì các thuộc tính thống kê giống như tập dữ liệu gốc hay không. Trong ý nghĩa này, điểm SQS có thể được xem là một điểm tiện ích hoặc điểm tin cậy về việc các kết luận khoa học rút ra từ tập dữ liệu tổng hợp sẽ giống như nếu bạn sử dụng tập dữ liệu gốc.
Điểm chất lượng dữ liệu tổng hợp được tính bằng cách kết hợp các chỉ số chất lượng cá nhân: Độ ổn định phân phối trường, Độ ổn định tương quan trường và Độ ổn định cấu trúc sâu.
Độ ổn định phân phối trường là một thước đo về việc dữ liệu tổng hợp duy trì phân phối trường giống như trong dữ liệu gốc. Độ ổn định tương quan trường là một thước đo về việc các tương quan giữa các trường được duy trì trong dữ liệu tổng hợp. Và cuối cùng, độ ổn định cấu trúc sâu đo lường tính toàn vẹn thống kê của các phân phối và tương quan đa trường. Để ước tính điều này, Gretel so sánh Phân tích thành phần chính (PCA) được tính toán trước trên dữ liệu gốc, sau đó lại trên dữ liệu tổng hợp.
Làm thế nào các bộ lọc bảo mật của Gretel hoạt động?
Các Bộ lọc bảo mật của Gretel là kết quả của nhiều nghiên cứu về bản chất của các cuộc tấn công đối với dữ liệu tổng hợp. Các Bộ lọc bảo mật ngăn chặn việc tạo dữ liệu tổng hợp có điểm yếu thường được khai thác bởi các cuộc tấn công. Chúng tôi có hai Bộ lọc bảo mật, đầu tiên là Bộ lọc tương tự và thứ hai là Bộ lọc ngoại lệ. Bộ lọc tương tự ngăn chặn việc tạo hồ sơ tổng hợp quá giống với hồ sơ đào tạo. Những hồ sơ này là mục tiêu chính của các cuộc tấn công nhằm mục đích thu thập thông tin về dữ liệu gốc. Bộ lọc bảo mật thứ hai là Bộ lọc ngoại lệ. Bộ lọc này ngăn chặn việc tạo hồ sơ tổng hợp sẽ được coi là ngoại lệ trong không gian được định nghĩa bởi dữ liệu đào tạo. Các ngoại lệ được tiết lộ trong một tập dữ liệu tổng hợp có thể bị khai thác bởi các cuộc tấn công suy luận thành viên, suy luận thuộc tính và nhiều loại cuộc tấn công đối thủ khác. Chúng là một rủi ro bảo mật nghiêm trọng.
Dữ liệu tổng hợp có thể giúp giảm thiểu thiên vị AI như thế nào?
Phương pháp phổ biến nhất là giải quyết sự thiên vị đại diện của dữ liệu đưa vào hệ thống AI. Ví dụ, nếu có sự mất cân bằng lớp mạnh trong dữ liệu của bạn, hoặc có thể có sự thiên vị dân số trong dữ liệu của bạn, Gretel cung cấp các công cụ để giúp đo lường sự mất cân bằng và sau đó giải quyết nó trong dữ liệu tổng hợp. Bằng cách loại bỏ thiên vị trong dữ liệu, bạn thường cũng loại bỏ thiên vị trong hệ thống AI được xây dựng trên dữ liệu đó.
Bạn rõ ràng yêu thích việc tìm hiểu về các công nghệ máy học mới, bạn làm thế nào để cập nhật tất cả các thay đổi?
Đọc, đọc và đọc thêm, lol! Tôi thích bắt đầu ngày mới bằng việc đọc về các công nghệ máy học mới. Tôi thích đọc các bài viết trên Towards Data Science, Analytics Vidhya và các bản tin như The Sequence. Facebook (META ) AI, Google (GOOGL ) AI và OpenMined đều có các blog tuyệt vời. Có rất nhiều hội nghị tuyệt vời để theo dõi như NeurIPS, ICML, ICLR, AISTATS.
Tôi cũng thích các công cụ theo dõi đường dẫn trích dẫn, giúp bạn tìm các bài báo tương tự như những bài báo bạn thích và những công cụ luôn theo dõi trong nền để tìm một bài báo có thể quan tâm đến bạn. Zeta Alpha là một công cụ như vậy mà tôi sử dụng rất nhiều.
Cuối cùng, bạn thực sự không thể đánh giá thấp lợi ích của việc có đồng nghiệp có cùng sở thích. Tại Gretel, nhóm máy học theo dõi các bài báo nghiên cứu liên quan đến các lĩnh vực chúng tôi khám phá và thường sẽ họp lại để thảo luận về các bài báo thú vị.
Ước mơ của bạn về tương lai của máy học là gì?
Truy cập dễ dàng vào dữ liệu sẽ khởi đầu một kỷ nguyên đổi mới lớn trong máy học, sau đó sẽ thúc đẩy đổi mới trong nhiều lĩnh vực như y tế, tài chính, sản xuất và sinh học. Lịch sử cho thấy, nhiều tiến bộ cơ bản trong ML có thể được quy cho một lượng lớn dữ liệu phong phú. Tuy nhiên, lịch sử cũng cho thấy nhiều nghiên cứu đã bị cản trở bởi sự không thể tiếp cận hoặc chia sẻ dữ liệu do lo ngại về bảo mật. Khi các công cụ như Gretel loại bỏ rào cản này, việc truy cập vào dữ liệu sẽ được dân chủ hóa. Toàn bộ cộng đồng máy học sẽ được hưởng lợi từ việc truy cập vào các tập dữ liệu lớn, phong phú, thay vì chỉ một số công ty mega tinh hoa.
Có gì khác bạn muốn chia sẻ về Gretel không?
Nếu bạn yêu thích dữ liệu, bạn sẽ yêu thích Gretel (vì vậy, rõ ràng tôi yêu thích Gretel!). Việc truy cập dễ dàng vào dữ liệu đã là một vấn đề trong lĩnh vực của mọi nhà khoa học dữ liệu mà tôi từng biết. Tại Gretel, chúng tôi tự hào về việc tạo ra một console và một tập hợp các API giúp tạo dữ liệu riêng tư, có thể chia sẻ một cách đơn giản nhất. Chúng tôi tin sâu rằng dữ liệu có giá trị hơn khi được chia sẻ.
Cảm ơn vì cuộc phỏng vấn tuyệt vời và vì đã chia sẻ những hiểu biết của bạn, những người đọc muốn tìm hiểu thêm nên truy cập Gretel.ai.












