Wawancara

Roshanak Houmanfar, Wakil Presiden Produk Pembelajaran Mesin di Integrate.ai – Seri Wawancara

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Roshanak (Ro) Houmanfar adalah Wakil Presiden produk pembelajaran mesin untuk integrate.ai, sebuah perusahaan yang membantu pengembang memecahkan masalah dunia yang paling penting tanpa mengambil risiko data sensitif. Ro memiliki kemampuan khusus untuk menemukan cara baru untuk menyederhanakan konsep AI yang kompleks dan menghubungkannya dengan kebutuhan pengguna. Dengan memanfaatkan keahlian ini, dia berada di garis depan misi integrate.ai untuk mendemokratisasikan akses ke teknologi yang meningkatkan privasi.

Apa yang awalnya menarik Anda ke ilmu data dan pembelajaran mesin?

Saya memulai perjalanan saya di bidang robotika. Setelah bereksperimen dengan berbagai sudut robotika, dan membakar laboratorium pengelasan, saya menyimpulkan bahwa saya lebih tertarik pada sisi kecerdasan buatan dari bidang saya, dan itu membawa saya ke dunia pembelajaran mesin yang luar biasa.

Bisakah Anda menjelaskan peran Anda saat ini dan seperti apa hari kerja rata-rata Anda?

Saya adalah Wakil Presiden Produk di integrate.ai, sebuah perusahaan SaaS yang membantu pengembang memecahkan masalah dunia yang paling penting tanpa mengambil risiko data sensitif. Kami sedang membangun alat untuk pembelajaran mesin dan analitik yang aman privasi untuk masa depan terdistribusi data.

Dalam kegiatan sehari-hari, saya bekerja dengan tim kami di seluruh fungsi untuk mencapai tiga hal:

Memikirkan apa yang mungkin terjadi di masa depan kecerdasan dan bagaimana kami dapat membentuk masa depan itu sehingga kecerdasan dapat memecahkan masalah yang paling kritis

Memahami titik sakit pelanggan kami dan bagaimana kami dapat berinovasi untuk membuat pekerjaan mereka lebih berdampak dan efisien.

Memastikan visi dan umpan balik pelanggan kami selalu dipertimbangkan dalam pengembangan produk, bekerja sama dengan tim kami untuk menghadirkan fitur terbaik.

Data sintetis saat ini sangat populer di pembelajaran mesin, tetapi integrate.ai mengambil pendekatan yang sedikit kontrarian. Apa saja aplikasi di mana data sintetis mungkin tidak menjadi pilihan yang diinginkan?

Untuk memahami kapan data sintetis tidak menjadi solusi terbaik, pertama-tama kita harus memahami kapan data sintetis benar-benar diperlukan. Data sintetis paling baik digunakan ketika target pemodelan memiliki jumlah data nyata yang kecil atau tidak ada sama sekali – misalnya, dalam masalah cold-start dan pelatihan model berbasis teks dan gambar. Terkadang, tidak ada cukup data yang diperlukan untuk melatih model, yang mana data sintetis bersinar sebagai solusi.

Namun, data sintetis semakin banyak digunakan dalam situasi di mana banyak data nyata ada, tetapi data tersebut terisolasi karena peraturan privasi, biaya sentralisasi, atau hambatan interoperabilitas lainnya. Ini adalah penyalahgunaan data sintetis. Dalam kasus penggunaan ini, sulit untuk menentukan tingkat abstraksi yang tepat untuk pembuatan data sintetis, yang menghasilkan data sintetis berkualitas rendah yang dapat menyebabkan bias bawaan atau masalah lainnya yang sulit didebug. Selain itu, model yang dilatih dengan data sintetis tidak sebanding dengan model yang dilatih dengan data nyata yang berkualitas tinggi dan granular.

Integrate.ai mengkhususkan diri dalam menawarkan solusi pembelajaran terdistribusi, bisakah Anda menjelaskan apa itu pembelajaran terdistribusi?

Dalam pembelajaran mesin tradisional, semua data pelatihan model harus disentralisasi dalam satu database. Dengan pembelajaran terdistribusi, model dapat dilatih pada dataset terdistribusi – atau data yang berada di dua atau lebih database terpisah dan tidak dapat dengan mudah dipindahkan. Bagaimana ini bekerja adalah bahwa bagian dari model pembelajaran mesin dilatih di mana data berada, dan parameter model dibagikan di antara dataset yang berpartisipasi untuk menghasilkan model global yang ditingkatkan. Dan karena tidak ada data yang dipindahkan dalam sistem, organisasi dapat melatih model tanpa hambatan seperti peraturan privasi dan keamanan, biaya, atau kekhawatiran sentralisasi lainnya.

Umumnya, data pelatihan yang dapat diakses dengan pembelajaran terdistribusi memiliki kualitas yang jauh lebih tinggi, karena data sentralisasi cenderung kehilangan sebagian granularitasnya demi kemudahan akses di satu lokasi.

Bagaimana suatu perusahaan dapat mengidentifikasi kasus penggunaan terbaik untuk pembelajaran terdistribusi?

Pembelajaran terdistribusi adalah teknologi tumpukan pembelajaran mesin yang dibangun untuk situasi di mana mengakses data atau membawanya ke infrastruktur pembelajaran mesin tradisional dengan danau data sentralisasi menyakitkan. Jika Anda mengalami salah satu gejala berikut, pembelajaran terdistribusi adalah untuk Anda:

  • Anda menyediakan produk pintar yang ditenagai oleh analitik dan pembelajaran mesin, dan Anda tidak dapat membuat efek jaringan untuk produk Anda karena data dimiliki oleh pelanggan Anda.
  • Anda bekerja melalui perjanjian jasa master yang panjang atau perjanjian berbagi data untuk mendapatkan akses ke data dari mitra Anda.
  • Anda menghabiskan banyak waktu untuk membentuk kontrak kolaborasi dengan mitra Anda, terutama dalam situasi di mana hasil dari kemitraan data ini tidak jelas bagi Anda.
  • Anda duduk di atas kekayaan data dan ingin memonetisasi dataset Anda, tetapi Anda takut akan implikasinya terhadap reputasi Anda.
  • Anda sudah memonetisasi data Anda, tetapi Anda menghabiskan banyak waktu, upaya, dan uang untuk membuat data aman untuk dibagikan.
  • Infrastruktur Anda telah ketinggalan selama peralihan ke cloud, tetapi Anda masih memerlukan analitik dan pembelajaran mesin.
  • Anda memiliki banyak anak perusahaan yang termasuk dalam organisasi yang sama, tetapi mereka tidak dapat langsung berbagi data dengan satu sama lain.
  • Dataset yang Anda tangani terlalu besar atau mahal untuk dipindahkan, sehingga Anda telah memutuskan untuk tidak menggunakannya atau pipa ETL Anda sangat mahal.
  • Anda memiliki aplikasi atau peluang yang Anda percayai dapat membuat dampak signifikan, tetapi Anda tidak memiliki data untuk membuatnya terjadi.
  • Model pembelajaran mesin Anda telah mencapai puncaknya, dan Anda tidak tahu bagaimana meningkatkannya lebih lanjut.

Privasi diferensial sering digunakan bersamaan dengan pembelajaran terdistribusi, apa ini secara khusus?

Privasi diferensial adalah teknik untuk memastikan privasi sambil memanfaatkan kekuatan pembelajaran mesin. Dengan menggunakan matematika yang berbeda dari teknik de-identifikasi standar, privasi diferensial menambahkan noise selama pelatihan model lokal, melestarikan sebagian besar fitur statistik dataset sambil membatasi risiko bahwa data individu akan diidentifikasi.

Dalam implementasi ideal, privasi diferensial membawa risiko mendekati nol, sementara model pembelajaran mesin mempertahankan kinerja yang serupa – memberikan semua keamanan yang diperlukan untuk de-identifikasi data, tanpa mengurangi kualitas hasil model.

Privasi diferensial termasuk dalam platform integrate.ai secara default, sehingga pengembang dapat memastikan bahwa data individu tidak dapat diinferensikan dari parameter model mereka.

Bisakah Anda menjelaskan bagaimana platform pembelajaran terdistribusi integrate.ai bekerja?

Platform kami memanfaatkan teknologi pembelajaran terdistribusi dan privasi diferensial untuk membuka berbagai kemampuan pembelajaran mesin dan analitik pada data yang biasanya sulit atau tidak mungkin diakses karena privasi, kerahasiaan, atau hambatan teknis. Operasi seperti pelatihan model dan analitik dilakukan secara lokal, dan hanya hasil akhir yang diagregasikan dengan cara yang aman dan rahasia.

integrate.ai dipaket sebagai alat pengembang, memungkinkan pengembang untuk dengan mudah mengintegrasikan kemampuan ini ke dalam hampir semua solusi dengan SDK yang mudah digunakan dan layanan cloud yang mendukung untuk manajemen ujung-ke-ujung. Setelah platform diintegrasikan, pengguna akhir dapat berkolaborasi di atas dataset sensitif sambil pemilik data mempertahankan kontrol penuh. Solusi yang mengintegrasikan integrate.ai dapat berfungsi sebagai alat eksperimen yang efektif dan layanan siap produksi.

Apa contoh cara platform ini dapat digunakan dalam diagnostik presisi?

Salah satu jaringan mitra yang kami kerjakan, Inisiatif Berbagi Autisme, mengumpulkan informasi terkait diagnosis autisme serta sampel data genom untuk memahami koneksi antara genotipe dan fenotipe yang berbeda dengan diagnosis autisme. Setiap situs data individu tidak memiliki cukup dataset untuk membuat model pembelajaran mesin berkinerja, tetapi secara kolektif mereka menciptakan ukuran sampel yang signifikan. Namun, memindahkan data membawa risiko tinggi terhadap keamanan dan privasi, dan karena peraturan dan kebijakan rumah sakit, lembaga penelitian ini selalu default ke tidak berbagi.

Dalam jaringan lain dengan pengaturan serupa, peneliti tertarik untuk meningkatkan penugasan uji klinis ke pasien dengan menggunakan pandangan yang lebih holistik tentang sejarah setiap pasien.

Lembaga penelitian yang terlibat memiliki akses ke berbagai informasi tentang setiap pasien– satu laboratorium memiliki akses ke pemindaian medis mereka, laboratorium lain memiliki akses ke informasi genom mereka, dan lembaga lain memiliki hasil uji klinis mereka. Namun, organisasi yang berbeda ini tidak dapat langsung berbagi informasi dengan satu sama lain.

Dengan solusi integrate.ai, setiap organisasi dapat mengakses data satu sama lain untuk tujuan mereka tanpa memindahkan data dari pemilik data dan dengan demikian mematuhi kebijakan internal mereka.

Bisakah Anda membahas pentingnya membuat privasi dapat dipahami dan bagaimana integrate.ai memungkinkan hal ini?

Membuat privasi dapat dipahami berarti membuka banyak pintu bagi bisnis dan organisasi yang secara historis tertutup karena sifat ambigu dari risiko. Peraturan privasi seperti GDPR, CCPA, dan HIPPA sangat kompleks dan dapat berbeda tergantung pada industri, wilayah, dan jenis data, membuatnya sulit bagi organisasi untuk menentukan proyek data mana yang aman dari segi privasi. Daripada membuang waktu dan tenaga untuk memeriksa setiap kotak, platform pembelajaran terdistribusi integrate.ai menawarkan privasi diferensial, enkripsi homomorfik, dan komputasi multi-pihak aman, sehingga pengembang dan pemilik data dapat tenang mengetahui bahwa proyek mereka akan secara otomatis memenuhi persyaratan peraturan, tanpa repot melompati setiap lingkaran kategori.

Apakah ada yang lain yang ingin Anda bagikan tentang integrate.ai?

Solusi integrate.ai adalah alat yang sangat ramah pengembang yang memungkinkan pembelajaran mesin dan analitik yang patuh, menjaga privasi, dan aman di atas sumber data sensitif. Melalui API yang mudah digunakan, semua kompleksitas kepatuhan peraturan dan kontrak di atas data sensitif diabstraksikan. Solusi integrate.ai memungkinkan ilmuwan data dan pengembang perangkat lunak untuk mengelola beban kerja mereka dengan aman dengan dampak minimal pada infrastruktur dan alur kerja saat ini.

Terima kasih atas wawancara yang luar biasa, pembaca yang ingin mempelajari lebih lanjut dapat mengunjungi integrate.ai.

Antoine adalah seorang pemimpin visioner dan rekan pendiri Unite.AI, yang dipandu oleh semangat tak tergoyahkan untuk membentuk dan mempromosikan masa depan AI dan robotika. Sebagai seorang wirausaha serial, ia percaya bahwa AI akan menjadi sangat mengganggu masyarakat seperti listrik, dan sering tertangkap berbicara tentang potensi teknologi disruptif dan AGI.

Sebagai seorang futuris, ia berdedikasi untuk mengeksplorasi bagaimana inovasi ini akan membentuk dunia kita. Selain itu, ia adalah pendiri Securities.io, sebuah platform yang berfokus pada investasi di teknologi-teknologi canggih yang mendefinisikan kembali masa depan dan membentuk kembali seluruh sektor.