Wawancara

Wilson Pang, Co-Penulis Buku Real World AI – Seri Wawancara

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Wilson Pang bergabung dengan Appen pada November 2018 sebagai CTO dan bertanggung jawab atas produk dan teknologi perusahaan. Wilson memiliki lebih dari sembilan belas tahun pengalaman dalam rekayasa perangkat lunak dan ilmu data. Sebelum bergabung dengan Appen, Wilson adalah chief data officer di Ctrip di Tiongkok, perusahaan biro perjalanan online terbesar kedua di dunia, di mana ia memimpin insinyur data, analis, manajer produk data, dan ilmuwan untuk meningkatkan pengalaman pengguna dan meningkatkan efisiensi operasional yang meningkatkan bisnis. Sebelum itu, ia adalah direktur teknik senior di eBay di California dan memberikan kepemimpinan di berbagai domain, termasuk layanan data dan solusi, ilmu pencarian, teknologi pemasaran, dan sistem penagihan. Ia bekerja sebagai arsitek di IBM sebelum eBay, membangun solusi teknologi untuk berbagai klien. Wilson memperoleh gelar master dan sarjana dalam teknik elektro dari Universitas Zhejiang di Tiongkok.

Kami membahas buku barunya: Dunia Nyata AI: Panduan Praktis untuk Pembelajaran Mesin yang Bertanggung Jawab

Anda menjelaskan bagaimana ketika Anda memimpin tim ilmu pencarian eBay, salah satu pelajaran pertama Anda dengan pembelajaran mesin adalah memahami pentingnya mengetahui metrik apa yang harus diukur. Contoh yang diberikan adalah bagaimana metrik “pembelian per sesi” gagal memperhitungkan nilai moneter suatu item. Bagaimana perusahaan dapat memahami metrik apa yang perlu diukur untuk menghindari masalah serupa?

Mulailah dengan tujuan yang Anda tetapkan untuk model AI – dalam kasus kami, kami ingin meningkatkan pendapatan dengan pembelajaran mesin. Ketika Anda menambahkan metrik ke tujuan, pikirkan tentang apa mekanisme yang akan dihasilkan oleh metrik tersebut, sekali Anda merilis model dan orang-orang mulai berinteraksi dengannya, tetapi juga catat asumsi Anda. Dalam kasus kami, kami berasumsi model akan mengoptimalkan pendapatan, tetapi jumlah pembelian per sesi tidak diterjemahkan ke dalam itu, karena model mengoptimalkan penjualan dengan nilai tiket rendah, dan pada akhirnya kami tidak membuat lebih banyak uang. Sekali kami menyadari itu, kami dapat mengubah metrik dan mengarahkan model ke arah yang benar. Jadi menentukan metrik granular, serta mencatat asumsi, sangat penting untuk kesuksesan proyek.

Apa yang Anda pelajari secara pribadi dari penelitian dan penulisan buku ini?

Kami memiliki banyak masalah yang dapat dipecahkan oleh AI dari perusahaan dan industri yang berbeda. Kasus penggunaan dapat sangat berbeda, solusi AI mungkin berbeda, data untuk melatih solusi AI itu mungkin berbeda. Namun, terlepas dari semua perbedaan itu, kesalahan yang dilakukan orang selama perjalanan AI mereka cukup mirip. Kesalahan-kesalahan itu terjadi lagi dan lagi di semua jenis perusahaan dari semua jenis industri.

Kami berbagi beberapa praktik terbaik ketika mengimplementasikan proyek AI dengan harapan membantu lebih banyak orang dan perusahaan untuk menghindari kesalahan-kesalahan itu dan memperoleh kepercayaan untuk mengirimkan AI yang bertanggung jawab.

Apa yang menjadi beberapa pelajaran paling penting yang Anda harapkan orang akan ambil dari membaca ini?

Kami percaya dengan kuat bahwa penggunaan pembelajaran mesin yang bertanggung jawab dan etis dapat membuat dunia menjadi lebih adil, adil, dan inklusif. Teknologi pembelajaran mesin berjanji untuk mengubah segalanya di seluruh dunia bisnis, tetapi itu tidak harus sulit. Ada metode dan proses yang telah teruji dan dapat diikuti oleh tim untuk memperoleh kepercayaan untuk mengirimkan ke produksi.

Pelajaran kunci lainnya adalah bahwa pemilik bisnis (seperti manajer produk) dan anggota tim di sisi teknis (seperti insinyur dan ilmuwan data) perlu berbicara dengan bahasa yang sama. Untuk mengirimkan AI secara sukses, pemimpin harus menjembatani kesenjangan antara tim, memberikan konteks yang cukup kepada spesialis bisnis dan tingkat C untuk berkomunikasi secara efisien dengan pelaksana teknis.

Banyak orang pertama kali memikirkan kode ketika mereka memikirkan AI. Salah satu pelajaran kunci dalam buku ini adalah bahwa data sangat penting untuk kesuksesan model AI. Ada banyak hal yang terkait dengan data, dari pengumpulan hingga pelabelan, penyimpanan, dan setiap langkah akan mempengaruhi kesuksesan model. Penerapan AI yang paling sukses adalah mereka yang menekankan data dan berusaha untuk terus memperbaiki aspek ini dari model ML mereka.

AI dunia nyata hanya membutuhkan tim lintas fungsional dan semangat inovatif.

Dibahas dalam buku adalah menentukan kapan akurasi model AI cukup tinggi untuk mendukung penggunaan AI. Apa cara termudah untuk menilai jenis akurasi yang diperlukan?

Tergantung pada kasus penggunaan dan toleransi risiko. Tim yang mengembangkan AI harus selalu memiliki fase pengujian di mana mereka menentukan tingkat akurasi dan ambang batas yang dapat diterima untuk organisasi dan pemangku kepentingan mereka. Untuk kasus penggunaan yang berpotensi membahayakan – di mana ada potensi bahaya jika AI salah, seperti perangkat lunak penjara, mobil self-driving, kasus medis, batang sangat tinggi – dan tim harus memasang kontinjensi jika model salah. Untuk kasus penggunaan yang lebih toleran kesalahan, di mana ada banyak subjektivitas – seperti konten, pencarian, atau relevansi iklan, tim dapat mengandalkan umpan balik pengguna untuk terus menyesuaikan model mereka bahkan saat produksi. Tentu saja, ada beberapa kasus penggunaan berisiko tinggi di sini, di mana materi ilegal atau tidak bermoral mungkin ditampilkan kepada pengguna, sehingga perlu ada mekanisme pengaman dan umpan balik.

Bagaimana Anda mendefinisikan pentingnya mendefinisikan keberhasilan untuk proyek di awal? 

Sangat penting untuk memulai dengan masalah bisnis serta mendefinisikan keberhasilan di awal sebagai dua hal yang terkait. Mengikuti contoh dalam buku tentang dealer otomotif yang menggunakan AI untuk melabeli gambar, mereka tidak menentukan apa yang terlihat seperti keberhasilan karena mereka tidak mendefinisikan masalah bisnis untuk dipecahkan. Keberhasilan bagi mereka bisa menjadi banyak hal yang berbeda, yang membuatnya sulit untuk memecahkan masalah, bahkan untuk tim orang, apalagi model pembelajaran mesin dengan cakupan tetap. Jika mereka menetapkan untuk melabeli semua kendaraan dengan lekukan untuk membuat daftar kendaraan yang perlu diperbaiki dan mendefinisikan keberhasilan sebagai pelabelan akurat 80% dari semua lekukan di inventaris mobil bekas, maka ketika mereka melabeli dengan akurat 85%, tim akan menyebutnya sukses. Tapi jika keberhasilan itu tidak terkait dengan masalah bisnis, dan dampak bisnis langsung, sulit untuk mengevaluasi proyek di luar definisi fokus pelabelan akurasi dalam contoh ini. Di sini, masalah bisnis lebih kompleks, dan pelabelan lekukan hanya salah satu komponennya. Dalam kasus mereka, mereka bisa lebih baik dengan mendefinisikan keberhasilan sebagai menghemat waktu/uang pada proses klaim atau mengoptimalkan proses perbaikan sebesar X% dan kemudian menerjemahkan dampak pelabelan ke dalam hasil bisnis nyata.

Seberapa pentingnya memastikan bahwa contoh data pelatihan mencakup semua kasus penggunaan yang akan terjadi dalam penerapan produksi?

Sangat penting bahwa model dilatih pada semua kasus penggunaan untuk menghindari bias. Namun, juga penting untuk mencatat bahwa, sementara mustahil untuk mencakup semua kasus penggunaan dalam produksi, tim yang membangun AI perlu memahami data produksi mereka, serta data pelatihan mereka, sehingga mereka melatih AI untuk apa yang akan mereka temui dalam produksi. Mengakses data pelatihan yang berasal dari kelompok besar dan beragam dengan berbagai kasus penggunaan akan sangat penting untuk kesuksesan model. Misalnya, model yang dilatih untuk mengenali hewan peliharaan seseorang dalam gambar yang diunggah perlu dilatih pada semua jenis hewan peliharaan; anjing, kucing, burung, mamalia kecil, kadal, dll. Jika model hanya dilatih pada anjing, kucing, dan burung, maka ketika seseorang mengunggah gambar dengan guinea pig mereka, model tidak akan dapat mengidentifikasinya. Sementara ini adalah contoh sederhana, itu menunjukkan bagaimana pelatihan pada sebanyak mungkin kasus penggunaan yang mungkin sangat penting untuk kesuksesan model.

Dibahas dalam buku adalah kebutuhan untuk mengembangkan kebiasaan kebersihan data yang baik dari atas ke bawah, apa saja langkah-langkah pertama untuk memupuk kebiasaan ini?

Kebiasaan kebersihan data yang baik akan meningkatkan kemampuan data internal dan mempersiapkannya untuk kasus penggunaan ML. Seluruh perusahaan harus menjadi baik dalam mengatur dan melacak dataset mereka. Salah satu cara untuk mencapai ini adalah dengan membuatnya menjadi persyaratan bisnis dan melacak implementasinya sehingga ada sangat sedikit laporan yang berakhir menjadi pekerjaan khusus, dan tim bekerja lebih dan lebih dengan pipa data yang diarahkan ke repositori pusat, dengan ontologi yang jelas. Praktik lain yang baik adalah menyimpan catatan kapan dan di mana data dikumpulkan dan apa yang terjadi pada data sebelum dimasukkan ke dalam database, serta mengembangkan proses untuk membersihkan data yang tidak terpakai atau data yang sudah ketinggalan zaman secara berkala.

Terima kasih atas wawancara yang luar biasa, bagi pembaca yang ingin mempelajari lebih lanjut, saya sarankan mereka membaca buku Dunia Nyata AI: Panduan Praktis untuk Pembelajaran Mesin yang Bertanggung Jawab.

Antoine adalah seorang pemimpin visioner dan rekan pendiri Unite.AI, yang dipandu oleh semangat tak tergoyahkan untuk membentuk dan mempromosikan masa depan AI dan robotika. Sebagai seorang wirausaha serial, ia percaya bahwa AI akan menjadi sangat mengganggu masyarakat seperti listrik, dan sering tertangkap berbicara tentang potensi teknologi disruptif dan AGI.

Sebagai seorang futuris, ia berdedikasi untuk mengeksplorasi bagaimana inovasi ini akan membentuk dunia kita. Selain itu, ia adalah pendiri Securities.io, sebuah platform yang berfokus pada investasi di teknologi-teknologi canggih yang mendefinisikan kembali masa depan dan membentuk kembali seluruh sektor.