Wawancara
Patricia Thaine, CEO di Private AI – Seri Wawancara

Patricia Thaine adalah Co-Founder dan CEO dari Private AI, seorang kandidat PhD Ilmu Komputer di Universitas Toronto, dan Affiliasi Pascasarjana di Institut Vektor yang melakukan penelitian tentang pengolahan bahasa alami yang menjaga privasi, dengan fokus pada kriptografi terapan. Dia juga melakukan penelitian tentang metode komputasi untuk dechipher bahasa yang hilang.
Patricia adalah penerima Beasiswa Pascasarjana NSERC, Beasiswa Pascasarjana RBC, Beasiswa Pascasarjana Beatrice “Trixie” Worsley di Ilmu Komputer, dan Beasiswa Pascasarjana Ontario. Dia memiliki delapan tahun pengalaman penelitian dan pengembangan perangkat lunak, termasuk di McGill Language Development Lab, Laboratorium Linguistik Komputasi Universitas Toronto, Departemen Linguistik Universitas Toronto, dan Badan Kesehatan Masyarakat Kanada.
Apa yang awalnya menarik Anda ke ilmu komputer?
Kemampuan untuk memecahkan masalah dan bersikap kreatif pada saat yang sama. Ini seperti sebuah kerajinan. Anda dapat melihat ide produk Anda menjadi kenyataan, seperti seorang tukang kayu membangun perabot. Ketika saya mendengar seseorang berkata suatu saat: pemrograman adalah alat kreatif yang ultimate. Fakta bahwa produk yang Anda bangun dapat diskalakan dan digunakan oleh orang-orang di seluruh dunia adalah seperti sebuah ceri di atas.
Apakah Anda dapat membahas tentang asal-usul Private AI dan bagaimana itu berasal dari pengamatan Anda bahwa ada kekurangan alat yang mudah diintegrasikan untuk menjaga privasi?
Melalui ucapan dan tulisan, beberapa informasi paling sensitif kita diproduksi dan ditransfer ke perusahaan yang kita gunakan. Ketika kita mempertimbangkan produk NLP mana yang akan kita bangun, ada lapisan privasi yang kita harus integrasikan yang tidak ada di pasar. Untuk menggunakan solusi privasi, perusahaan harus mentransfer data pengguna mereka ke pihak ketiga, menggunakan solusi sumber terbuka yang tidak cukup baik untuk melindungi privasi pengguna, atau membangun solusi di dalam dengan sangat sedikit keahlian dalam privasi. Jadi, kita memutuskan untuk fokus pada menciptakan produk terbaik bagi pengembang dan tim AI yang perlu memiliki output teknologi privasi yang ditingkatkan dengan mudah bekerja untuk kebutuhan mereka.
Mengapa AI yang menjaga privasi itu penting?
Kira-kira 80 persen informasi yang diproduksi tidak terstruktur dan AI adalah satu-satunya cara untuk memahami semua data tersebut. Ini dapat digunakan untuk kebaikan, seperti membantu mendeteksi jatuh untuk populasi lanjut usia, atau untuk kejahatan, seperti memprofil dan melacak individu dari populasi yang kurang terwakili. Memastikan bahwa privasi dibangun ke dalam perangkat lunak yang kita ciptakan membuatnya jauh lebih sulit untuk AI digunakan dengan cara yang merugikan.
Bagaimana privasi menjadi keunggulan kompetitif?
Ada beberapa alasan, tetapi berikut beberapa di antaranya:
- Lebih banyak pengguna peduli tentang privasi dan, ketika konsumen menjadi lebih berpendidikan, kekhawatiran ini tumbuh: 70 persen konsumen khawatir tentang privasi data mereka.
- Sangat mudah untuk melakukan bisnis dengan bisnis lain jika Anda memiliki protokol perlindungan data dan teknologi privasi yang tepat.
- Ketika Anda telah membangun produk Anda dengan cara yang menjaga privasi, Anda menjaga jejak yang lebih baik tentang di mana titik-titik kerentanan dalam layanan Anda dan, terutama melalui minimisasi data, Anda menghilangkan data yang tidak perlu dan akan mendapatkan Anda dalam masalah ketika serangan siber terjadi.
Apakah Anda dapat membahas tentang pentingnya privasi data pelatihan dan mengapa itu rentan terhadap reverse engineering?
Pertanyaan yang sangat baik dan perlu banyak pendidikan tentang hal ini. Secara sederhana, model machine learning mengingat informasi. Semakin besar model, semakin banyak informasi yang diingat. Ini berarti bahwa informasi yang model tersebut pelajari dapat dihasilkan kembali dalam produksi. Ini telah ditunjukkan dalam beberapa kertas penelitian, termasuk The Secret Sharer: Evaluasi dan Pengujian Unintended Memorization in Neural Networks dan Ekstraksi Data Pelatihan dari Model Bahasa Besar.
Ini juga telah ditunjukkan bahwa informasi pribadi dapat diekstrak dari word embeddings dan, bagi mereka yang meragukan ini adalah masalah nyata, ada skandal tahun ini ketika sebuah bot cinta Korea menulis detail pengguna dalam percakapan dengan pengguna lain.
Apakah Anda memiliki pandangan tentang federated learning dan privasi pengguna?
Federated learning adalah langkah yang baik ketika kasus penggunaan memungkinkan. Namun, masih memungkinkan untuk mengekstrak informasi tentang input pengguna dari pembaruan bobot yang dikirim ke awan dari perangkat pengguna tertentu, sehingga penting untuk menggabungkan federated learning dengan teknologi privasi lainnya (privasi diferensial dan enkripsi homomorfik/komputasi multipihak yang aman). Setiap teknologi privasi harus dipilih sesuai dengan kasus penggunaan – tidak ada yang dapat digunakan sebagai palu untuk memecahkan semua masalah. Kami membahas pohon keputusan di sini. Salah satu keuntungan besar adalah bahwa Anda tidak pernah mengirim data mentah Anda ke luar perangkat Anda. Salah satu kelemahan besar adalah bahwa jika Anda perlu data untuk memecahkan masalah sistem atau melihat apakah itu sedang dilatih dengan benar, itu menjadi jauh lebih sulit untuk diperoleh. Federated learning adalah awal yang baik dengan banyak masalah yang belum terpecahkan yang sedang dikerjakan oleh penelitian dan industri.
Private AI memungkinkan pengembang untuk mengintegrasikan analisis privasi dengan beberapa baris kode untuk memastikan privasi, bagaimana ini bekerja?
Teknologi kami berjalan sebagai REST API yang pengguna kami kirimkan permintaan POST ke dengan teks yang mereka ingin redaksi, de-identifikasi, atau pseudonimisasi/augmentasi dengan data realistis. Beberapa pelanggan kami mengirimkan transkrip panggilan yang perlu dihapus untuk memenuhi PCI, sementara yang lain mengirimkan seluruh obrolan sehingga mereka dapat menggunakan informasi tersebut untuk melatih chatbot, analisis sentimen, atau model NLP lainnya. Pengguna kami juga dapat memilih entitas yang mereka butuhkan untuk disimpan atau bahkan digunakan sebagai metadata untuk melacak di mana data pribadi disimpan. Kami menghilangkan sakit kepala memiliki untuk melatih sistem yang akurat untuk mendeteksi dan menggantikan informasi pribadi dalam data yang sangat kacau.
Mengapa privasi untuk perangkat IoT adalah masalah saat ini dan apa pandangan Anda tentang memecahkannya?
Akhirnya, cara terbaik untuk memecahkan masalah privasi adalah sangat tergantung pada kasus penggunaan, dan perangkat IoT tidak berbeda. Sementara beberapa kasus penggunaan mungkin bergantung pada penerapan edge, inferensi edge, dan federated learning yang menjaga privasi (misalnya, crowd sensing di kota pintar), kasus penggunaan lain mungkin perlu bergantung pada agregasi data dan anonimisasi (misalnya, informasi penggunaan energi). Dengan demikian, perangkat IoT adalah contoh yang sangat baik tentang bagaimana privasi dan keamanan harus berjalan beriringan. Perangkat ini sangat rentan terhadap serangan siber, sehingga tidak ada yang dapat dilakukan teknologi privasi tanpa memperbaiki kerentanan perangkat inti. Di sisi lain, tanpa memikirkan cara untuk meningkatkan privasi pengguna, informasi yang dikumpulkan dari dalam rumah kita dapat dibagikan, tanpa dicek, ke pihak yang tidak diketahui, membuatnya sangat sulit untuk menjamin keamanan informasi. Kami memiliki dua front untuk diperbaiki di sini dan legislasi draf yang sedang ditulis oleh Komisi Eropa tentang keamanan perangkat IoT mungkin akan menjadi apa yang mengguncang produsen perangkat untuk mengambil tanggung jawab mereka terhadap keamanan dan privasi konsumen dengan serius.
Apakah ada yang lain yang Anda ingin bagikan tentang Private AI?
Kami adalah sekelompok ahli dalam privasi, bahasa alami, bahasa lisan, pemrosesan gambar, penerapan model machine learning di lingkungan sumber daya rendah, didukung oleh M12, dana ventura Microsoft (MSFT ).
Kami memastikan bahwa produk yang kami ciptakan, di atas being sangat akurat, juga komputasi yang efisien sehingga Anda tidak memiliki tagihan awan yang besar di tangan Anda di akhir bulan. Juga, data pelanggan kami tidak pernah ditransfer ke kami – semua diproses di lingkungan mereka sendiri.
Terima kasih atas wawancara yang luar biasa, untuk mempelajari lebih lanjut kunjungi Private AI.












