Phỏng vấn
Roshanak Houmanfar, Phó Chủ tịch Sản phẩm Học máy tại Integrate.ai – Loạt Phỏng vấn

Roshanak (Ro) Houmanfar là Phó Chủ tịch sản phẩm học máy cho integrate.ai, một công ty giúp các nhà phát triển giải quyết các vấn đề quan trọng nhất trên thế giới mà không cần phải mạo hiểm với dữ liệu nhạy cảm. Ro có một khả năng đặc biệt trong việc tìm ra những cách mới để đơn giản hóa các khái niệm học máy phức tạp và kết nối chúng với nhu cầu của người dùng. Với chuyên môn này, cô đang ở vị trí tiên phong trong sứ mệnh của integrate.ai nhằm dân chủ hóa việc tiếp cận công nghệ tăng cường quyền riêng tư.
Điều gì đã thu hút bạn đến khoa học dữ liệu và học máy?
Tôi bắt đầu hành trình của mình trong lĩnh vực robot. Sau khi thử nghiệm với các góc độ khác nhau của robot và làm cháy một phòng thí nghiệm hàn, tôi đã kết luận rằng tôi bị thu hút nhiều hơn bởi phía trí tuệ nhân tạo của lĩnh vực của mình, và điều đó đã dẫn tôi đến thế giới tuyệt vời của học máy.
Có thể bạn mô tả vai trò hiện tại của mình và một ngày làm việc trung bình của bạn như thế nào?
Tôi là Phó Chủ tịch Sản phẩm tại integrate.ai, một công ty SaaS giúp các nhà phát triển giải quyết các vấn đề quan trọng nhất trên thế giới mà không cần phải mạo hiểm với dữ liệu nhạy cảm. Chúng tôi đang xây dựng các công cụ cho học máy và phân tích an toàn quyền riêng tư cho tương lai phân tán của dữ liệu.
Trong công việc hàng ngày của mình, tôi làm việc với các nhóm của chúng tôi trên các chức năng để đạt được ba điều:
Làm việc thông qua tương lai của trí tuệ có thể trông như thế nào và làm thế nào chúng tôi có thể định hình tương lai đó để trí tuệ giải quyết các vấn đề quan trọng nhất
Hiểu các điểm đau của khách hàng và làm thế nào chúng tôi có thể đổi mới để làm cho công việc của họ có tác động và hiệu quả hơn.
Đảm bảo tầm nhìn và phản hồi của khách hàng luôn được xem xét trong quá trình phát triển sản phẩm, làm việc hợp tác với các nhóm của chúng tôi để cung cấp các tính năng tốt nhất.
Dữ liệu tổng hợp hiện đang là tất cả sự cuồng nhiệt trong học máy, nhưng integrate.ai lại có một cách tiếp cận trái ngược. Có những ứng dụng nào mà dữ liệu tổng hợp có thể không phải là một lựa chọn mong muốn?
Để hiểu khi nào dữ liệu tổng hợp không phải là giải pháp tốt nhất, trước tiên cần hiểu khi nào nó là giải pháp tốt nhất. Dữ liệu tổng hợp được sử dụng tốt nhất khi mục tiêu mô hình có ít dữ liệu thực hoặc không có dữ liệu nào – ví dụ, trong các vấn đề khởi động lạnh và đào tạo mô hình dựa trên văn bản và hình ảnh. Đôi khi, chỉ đơn giản là không có đủ dữ liệu cần thiết để đào tạo một mô hình, đó là khi dữ liệu tổng hợp tỏa sáng như một giải pháp.
Tuy nhiên, dữ liệu tổng hợp đang ngày càng được sử dụng trong các tình huống mà có rất nhiều dữ liệu thực tồn tại, nhưng dữ liệu đó bị cô lập do các quy định về quyền riêng tư, chi phí tập trung hoặc các rào cản liên operability khác. Đây là một sự lạm dụng dữ liệu tổng hợp. Trong các trường hợp sử dụng này, rất khó để xác định mức độ trừu tượng hóa đúng cho việc tạo dữ liệu tổng hợp, dẫn đến dữ liệu tổng hợp chất lượng thấp có thể gây ra các vấn đề như thiên vị hoặc các vấn đề khác khó gỡ lỗi. Ngoài ra, các mô hình được đào tạo trên dữ liệu tổng hợp không thể so sánh với các mô hình được đào tạo trên dữ liệu thực chất lượng cao, chi tiết.
Integrate.ai chuyên cung cấp các giải pháp học máy phân tán, bạn có thể mô tả học máy phân tán là gì?
Trong học máy truyền thống, tất cả dữ liệu đào tạo mô hình phải được tập trung trong một cơ sở dữ liệu. Với học máy phân tán, các mô hình có thể được đào tạo trên các tập dữ liệu phân tán – hoặc dữ liệu nằm trong hai hoặc nhiều cơ sở dữ liệu riêng biệt và không thể dễ dàng di chuyển. Cách nó hoạt động là các phần của mô hình học máy được đào tạo ở nơi dữ liệu nằm, và các tham số mô hình được chia sẻ giữa các tập dữ liệu tham gia để tạo ra một mô hình toàn cầu được cải thiện. Và vì không có dữ liệu di chuyển trong hệ thống, các tổ chức có thể đào tạo mô hình mà không có các rào cản như quy định về quyền riêng tư, bảo mật, chi phí hoặc các mối quan tâm tập trung khác.
Nói chung, dữ liệu đào tạo có thể truy cập được với học máy phân tán là của chất lượng cao hơn nhiều, vì dữ liệu tập trung có xu hướng mất một số chi tiết của nó để đổi lấy sự tiện lợi của việc truy cập ở một vị trí.
Làm thế nào một doanh nghiệp xác định các trường hợp sử dụng tốt nhất cho học máy phân tán?
Học máy phân tán là một công nghệ học máy được xây dựng cho các tình huống mà việc truy cập dữ liệu hoặc đưa dữ liệu vào cơ sở hạ tầng truyền thống của học máy với các hồ dữ liệu tập trung là đau đớn. Nếu bạn đang gặp phải một trong các triệu chứng sau, học máy phân tán là dành cho bạn:
- Bạn cung cấp các sản phẩm thông minh được hỗ trợ bởi phân tích và học máy và bạn không thể tạo ra các hiệu ứng mạng cho các sản phẩm của mình vì dữ liệu thuộc sở hữu của khách hàng của bạn.
- Bạn đang làm việc thông qua các thỏa thuận dịch vụ chính hoặc thỏa thuận chia sẻ dữ liệu để có được quyền truy cập vào dữ liệu từ các đối tác của bạn.
- Bạn đang dành nhiều thời gian để hình thành các hợp đồng hợp tác với các đối tác của bạn, đặc biệt là trong các tình huống mà kết quả của quan hệ đối tác dữ liệu này không rõ ràng với bạn.
- Bạn đang ngồi trên một kho dữ liệu và muốn kiếm tiền từ các tập dữ liệu của mình nhưng sợ hãi về các tác động đến danh tiếng của bạn.
- Bạn đã kiếm tiền từ dữ liệu của mình, nhưng bạn đang dành nhiều thời gian, công sức và tiền bạc để làm cho dữ liệu an toàn để chia sẻ.
- Cơ sở hạ tầng của bạn đã bị bỏ lại trong quá trình chuyển sang đám mây, nhưng bạn vẫn cần phân tích và học máy.
- Bạn có nhiều công ty con thuộc cùng một tổ chức nhưng không thể chia sẻ dữ liệu trực tiếp với nhau.
- Các tập dữ liệu bạn đang xử lý quá lớn hoặc quá tốn kém để di chuyển nên bạn đã quyết định không sử dụng chúng hoặc các đường ống ETL của bạn tốn kém.
- Bạn có một ứng dụng hoặc cơ hội mà bạn tin rằng có thể tạo ra tác động đáng kể, nhưng bạn không có dữ liệu để làm cho nó xảy ra.
- Các mô hình học máy của bạn đã đạt đến giới hạn và bạn không biết làm thế nào để cải thiện chúng thêm.
Riêng tư phân biệt thường được sử dụng cùng với học máy phân tán, điều này cụ thể là gì?
Riêng tư phân biệt là một kỹ thuật để đảm bảo quyền riêng tư đồng thời tận dụng sức mạnh của học máy. Sử dụng toán học khác với các kỹ thuật ẩn danh hóa tiêu chuẩn, riêng tư phân biệt thêm nhiễu trong quá trình đào tạo mô hình cục bộ, bảo tồn hầu hết các tính năng thống kê của tập dữ liệu trong khi hạn chế rủi ro rằng dữ liệu của bất kỳ cá nhân nào sẽ được xác định.
Trong các triển khai lý tưởng, riêng tư phân biệt mang lại rủi ro gần như bằng không, trong khi các mô hình học máy vẫn duy trì hiệu suất tương tự – cung cấp tất cả bảo mật cần thiết cho việc ẩn danh hóa dữ liệu, mà không giảm chất lượng của kết quả mô hình.
Riêng tư phân biệt được tích hợp trong nền tảng integrate.ai theo mặc định, vì vậy các nhà phát triển có thể đảm bảo rằng dữ liệu cá nhân không thể được suy đoán từ các tham số mô hình của họ.
Có thể bạn mô tả cách nền tảng học máy phân tán của integrate.ai hoạt động?
Nền tảng của chúng tôi tận dụng công nghệ học máy phân tán và riêng tư phân biệt để mở khóa một loạt các khả năng học máy và phân tích trên dữ liệu mà nếu không sẽ khó hoặc không thể truy cập được do các rào cản về quyền riêng tư, bảo mật hoặc kỹ thuật. Các hoạt động như đào tạo mô hình và phân tích được thực hiện cục bộ, và chỉ các kết quả cuối cùng được tổng hợp một cách an toàn và bảo mật.
Integrate.ai được đóng gói như một công cụ dành cho nhà phát triển, cho phép các nhà phát triển tích hợp các khả năng này vào gần như bất kỳ giải pháp nào với một bộ phát triển phần mềm (SDK) dễ sử dụng và dịch vụ đám mây hỗ trợ cho quản lý từ đầu đến cuối. Một khi nền tảng đã được tích hợp, người dùng cuối có thể cộng tác trên các tập dữ liệu nhạy cảm trong khi người giám sát vẫn giữ quyền kiểm soát đầy đủ. Các giải pháp tích hợp integrate.ai có thể hoạt động như cả công cụ thử nghiệm hiệu quả và dịch vụ sẵn sàng sản xuất.
Có thể bạn đưa ra một số ví dụ về cách nền tảng này có thể được sử dụng trong chẩn đoán chính xác?
Một trong những mạng lưới đối tác chúng tôi đang làm việc với, Sáng kiến Chia sẻ Tự kỷ, thu thập thông tin liên quan đến chẩn đoán tự kỷ cũng như mẫu dữ liệu gen để hiểu mối quan hệ giữa các kiểu gen và kiểu hình khác nhau với chẩn đoán tự kỷ. Mỗi trang web dữ liệu riêng lẻ không có đủ tập dữ liệu để làm cho các mô hình học máy hoạt động, nhưng tập thể họ tạo ra một kích thước mẫu có ý nghĩa. Tuy nhiên, việc di chuyển dữ liệu gây ra rủi ro cao cho bảo mật và quyền riêng tư, và do các quy định và chính sách bệnh viện, các viện nghiên cứu này đã luôn mặc định không chia sẻ.
Trong một mạng lưới khác, với một thiết lập tương tự, các nhà nghiên cứu quan tâm đến việc cải thiện việc gán các thử nghiệm lâm sàng cho bệnh nhân bằng cách sử dụng một cái nhìn toàn diện hơn về lịch sử của từng bệnh nhân.
Các viện nghiên cứu khác nhau tham gia có quyền truy cập vào các thông tin khác nhau về từng bệnh nhân – một phòng thí nghiệm có quyền truy cập vào các bản quét y tế của họ, phòng thí nghiệm khác có quyền truy cập vào thông tin gen của họ, và một viện khác có kết quả thử nghiệm lâm sàng của họ. Nhưng các tổ chức khác nhau này không thể chia sẻ thông tin trực tiếp với nhau.
Với giải pháp integrate.ai, mỗi tổ chức có thể truy cập vào dữ liệu của nhau cho các mục tiêu của mình mà không cần di chuyển dữ liệu khỏi người giám sát và do đó tuân thủ các chính sách nội bộ của họ.
Có thể bạn thảo luận về tầm quan trọng của việc làm cho quyền riêng tư trở nên dễ hiểu và integrate.ai làm thế nào để cho phép điều này?
Làm cho quyền riêng tư trở nên dễ hiểu có nghĩa là mở ra rất nhiều cánh cửa cho các doanh nghiệp và tổ chức đã từng bị đóng do bản chất mơ hồ của rủi ro. Các quy định về quyền riêng tư như GDPR, CCPA và HIPPA vô cùng phức tạp và có thể khác nhau tùy thuộc vào ngành, khu vực và loại dữ liệu, khiến cho các tổ chức khó xác định các dự án dữ liệu nào là an toàn về quyền riêng tư. Thay vì lãng phí thời gian và nhân lực để kiểm tra mọi hộp, nền tảng học máy phân tán của integrate.ai cung cấp riêng tư phân biệt, mã hóa đồng hình và tính toán đa bên an toàn, vì vậy các nhà phát triển và người giám sát dữ liệu có thể yên tâm biết rằng các dự án của họ sẽ tự động tuân thủ các yêu cầu quy định, mà không cần phải nhảy qua từng vòng tròn.
Có gì khác bạn muốn chia sẻ về integrate.ai?
Giải pháp của integrate.ai là một công cụ cực kỳ thân thiện với nhà phát triển, cho phép học máy và phân tích an toàn quyền riêng tư và bảo mật trên các nguồn dữ liệu nhạy cảm. Thông qua các API dễ sử dụng, tất cả sự phức tạp của việc tuân thủ quy định và hợp đồng trên các dữ liệu nhạy cảm được trừu tượng hóa. Giải pháp của integrate.ai cho phép các nhà khoa học dữ liệu và nhà phát triển phần mềm quản lý công việc của họ một cách an toàn với tác động tối thiểu đến cơ sở hạ tầng và quy trình làm việc hiện tại của họ.
Cảm ơn bạn vì cuộc phỏng vấn tuyệt vời, những người đọc muốn tìm hiểu thêm nên truy cập integrate.ai.












