Wawancara

Amr Nour-Eldin, Wakil Presiden Teknologi di LXT – Seri Wawancara

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Amr Nour-Eldin, adalah Wakil Presiden Teknologi di LXT. Amr adalah seorang ilmuwan peneliti Ph.D. dengan lebih dari 16 tahun pengalaman profesional di bidang pengolahan suara/audio dan pembelajaran mesin dalam konteks Pengenalan Suara Otomatis (ASR), dengan fokus khusus dan pengalaman tangan pada teknik pembelajaran dalam untuk pengenalan suara streaming akhir-ke-akhir.

LXT adalah pemimpin baru di bidang data pelatihan AI untuk memberdayakan teknologi cerdas bagi organisasi global. Dalam kemitraan dengan jaringan kontributor internasional, LXT mengumpulkan dan menandai data di seluruh modality dengan kecepatan, skala, dan fleksibilitas yang dibutuhkan oleh perusahaan. Keahlian global mereka mencakup lebih dari 145 negara dan lebih dari 1000 lokasi bahasa.

Anda mengejar gelar Ph.D. di Signal Processing dari McGill University, apa yang awalnya menarik Anda ke bidang ini?

Saya selalu ingin mempelajari teknik, dan benar-benar menyukai ilmu pengetahuan alam secara umum, tetapi lebih spesifik tertarik pada matematika dan fisika. Saya menemukan diri saya selalu mencoba memahami bagaimana alam bekerja dan bagaimana menerapkan pemahaman itu untuk menciptakan teknologi. Setelah sekolah menengah, saya memiliki kesempatan untuk masuk ke bidang kedokteran dan profesi lain, tetapi secara khusus memilih teknik karena itu merupakan kombinasi yang sempurna dalam pandangan saya antara teori dan aplikasi dalam dua bidang yang paling dekat dengan hati saya: matematika dan fisika. Dan kemudian, setelah saya memilihnya, ada banyak jalur yang mungkin – mekanik, sipil, dan sebagainya. Tetapi saya secara khusus memilih teknik elektro karena itu adalah yang paling dekat, dan yang paling sulit dalam pandangan saya, dengan jenis masalah matematika dan fisika yang saya temukan menantang dan menyenangkan, serta merupakan dasar dari teknologi modern yang selalu menginspirasi saya.

Di dalam teknik elektro, ada berbagai spesialisasi yang dapat dipilih, yang umumnya jatuh di bawah dua payung: telekomunikasi dan pengolahan sinyal, dan yang lainnya adalah tenaga dan teknik elektro. Ketika saatnya tiba untuk memilih di antara keduanya, saya memilih telekom dan pengolahan sinyal karena itu lebih dekat dengan bagaimana kita menjelaskan alam melalui fisika dan persamaan. Anda berbicara tentang sinyal, apakah itu audio, gambar, atau video; memahami bagaimana kita berkomunikasi dan apa yang kita rasakan, dan bagaimana mewakili informasi itu secara matematis sehingga kita dapat memanfaatkan pengetahuan itu untuk menciptakan dan meningkatkan teknologi.

Bisakah Anda membahas penelitian Anda di McGill University tentang aspek informasi-teoretis dari ekstensi bandwidth buatan (BWE)?

Setelah saya menyelesaikan gelar sarjana, saya ingin terus mempelajari bidang Pengolahan Sinyal secara akademis. Setelah satu tahun mempelajari Fotonik sebagai bagian dari gelar Master di Fisika, saya memutuskan untuk kembali ke Teknik untuk mempelajari master di Audio dan Pengolahan Sinyal, dengan fokus pada pengenalan suara. Ketika saatnya tiba untuk melakukan Ph.D., saya ingin memperluas bidang saya sedikit ke pengolahan audio dan suara secara umum, serta bidang yang terkait erat dengan Pembelajaran Mesin dan Teori Informasi, daripada hanya fokus pada aplikasi pengenalan suara.

Kendaraan untuk Ph.D. saya adalah ekstensi bandwidth suara narrowband. Suara narrowband merujuk pada telepon konvensional. Konten informasi suara meluas hingga sekitar 20 kilohertz, tetapi sebagian besar konten informasi terkonsentrasi hingga hanya 4 kilohertz. Ekstensi bandwidth merujuk pada memperluas konten suara dari 3,4 kilohertz, yang merupakan batas atas frekuensi dalam telepon konvensional, ke atas, hingga delapan kilohertz atau lebih. Untuk lebih baik merekonstruksi konten suara yang hilang itu, diperlukan untuk mengkuantifikasi informasi bersama antara konten suara dalam dua pita frekuensi, kemudian menggunakan informasi itu untuk melatih model yang belajar informasi bersama itu; model yang, setelah dilatih, dapat digunakan untuk menghasilkan konten wideband diberikan hanya suara narrowband dan apa yang model pelajari tentang hubungan antara suara narrowband yang tersedia dan konten wideband yang hilang. Mengkuantifikasi dan mewakili informasi bersama itu adalah tempat Teori Informasi masuk. Teori Informasi adalah studi tentang mengkuantifikasi dan mewakili informasi dalam suatu sinyal. Jadi, penelitian saya tentang menggabungkan Teori Informasi untuk meningkatkan ekstensi bandwidth buatan suara. Sebagai itu, Ph.D. saya lebih merupakan kegiatan penelitian antar disiplin ilmu di mana saya menggabungkan pengolahan sinyal dengan Teori Informasi dan Pembelajaran Mesin.

Anda adalah Ilmuwan Utama Suara di Nuance Communications, sekarang bagian dari Microsoft (MSFT ), selama lebih dari 16 tahun, apa yang menjadi kesan utama Anda dari pengalaman ini?

Dari perspektif saya, manfaat paling penting adalah bahwa saya selalu bekerja pada teknik mutakhir, canggih dalam pengolahan sinyal dan pembelajaran mesin dan menerapkan teknologi itu pada aplikasi dunia nyata. Saya mendapatkan kesempatan untuk menerapkan teknik itu pada produk AI Konversasional di seluruh domain. Domain tersebut mencakup perusahaan, kesehatan, otomotif, mobilitas, dan lain-lain. Beberapa aplikasi spesifik termasuk asisten virtual, respons suara interaktif, voicemail ke teks, dan lain-lain di mana representasi dan transkripsi yang tepat sangat penting, seperti dalam kesehatan dengan interaksi dokter-pasien. Selama 16 tahun itu, saya beruntung dapat menyaksikan langsung dan menjadi bagian dari evolusi AI konversasional, dari hari-hari model statistik menggunakan Hidden Markov Models, melalui pengambilalihan bertahap Pembelajaran Dalam, hingga sekarang di mana pembelajaran dalam mendominasi hampir semua aspek AI, termasuk AI Generatif serta AI prediktif atau diskriminatif tradisional. Kesan utama lain dari pengalaman itu adalah peran krusial yang dimainkan data, melalui kuantitas dan kualitas, sebagai penggerak kemampuan dan kinerja model AI.

Anda telah menerbitkan lebih dari selusin makalah, termasuk di publikasi terkemuka seperti IEEE. Menurut Anda, apa makalah yang paling berdampak yang Anda terbitkan dan mengapa itu penting?

Makalah yang paling berdampak, menurut jumlah kutipan menurut Google (GOOGL ) Scholar, akan menjadi makalah 2008 yang berjudul “Mel-Frequency Cepstral Coefficient-Based Bandwidth Extension of Narrowband Speech”. Pada tingkat tinggi, fokus makalah ini adalah tentang bagaimana merekonstruksi konten suara menggunakan representasi fitur yang secara luas digunakan dalam bidang pengenalan suara otomatis (ASR), koefisien cepstral frekuensi mel.

Namun, makalah yang lebih inovatif menurut saya adalah makalah dengan kutipan kedua terbanyak, yaitu makalah 2011 yang berjudul “Memory-Based Approximation of the Gaussian Mixture Model Framework for Bandwidth Extension of Narrowband Speech“. Dalam karya itu, saya mengusulkan teknik pemodelan statistik baru yang menggabungkan informasi temporal dalam suara. Kelebihan teknik itu adalah bahwa itu memungkinkan pemodelan informasi jangka panjang dalam suara dengan kompleksitas tambahan yang minimal dan dengan cara yang masih memungkinkan generasi suara wideband dalam mode streaming atau waktu nyata.

Pada Juni 2023, Anda direkrut sebagai Wakil Presiden Teknologi di LXT, apa yang menarik Anda ke posisi ini?

Di seluruh pengalaman akademis dan profesional saya sebelum LXT, saya selalu bekerja langsung dengan data. Faktanya, seperti yang saya sebutkan sebelumnya, salah satu kesan utama saya dari pekerjaan saya dengan ilmu suara dan pembelajaran mesin adalah peran krusial yang dimainkan data dalam siklus hidup model AI. Memiliki data berkualitas yang cukup dalam format yang tepat sangat penting untuk kesuksesan model AI berbasis pembelajaran dalam mutakhir. Sebagai itu, ketika saya berada pada tahap karir di mana saya mencari lingkungan startup di mana saya bisa belajar, memperluas keterampilan saya, serta menggunakan pengalaman suara dan AI saya untuk memiliki dampak terbesar, saya beruntung memiliki kesempatan untuk bergabung dengan LXT. Ini adalah kesempatan yang tepat. LXT tidak hanya merupakan penyedia data AI yang tumbuh dengan kecepatan dan konsistensi yang mengesankan, tetapi saya juga melihatnya sebagai perusahaan yang berada pada tahap pertumbuhan yang tepat dalam hal pengetahuan AI serta sumber daya, dan oleh karena itu dalam jenis data AI dan klien. Saya sangat menghargai kesempatan untuk bergabung dan membantu dalam perjalanan pertumbuhan mereka; untuk memiliki dampak besar dengan membawa perspektif pengguna akhir data setelah menjadi ilmuwan data AI selama bertahun-tahun.

Apa yang menjadi gambaran hari Anda di LXT?

Hari saya biasanya dimulai dengan melihat penelitian terbaru tentang topik tertentu atau lainnya, yang akhir-akhir ini berfokus pada AI generatif, dan bagaimana kita dapat menerapkannya pada kebutuhan klien kita. Saya beruntung memiliki tim yang sangat terampil dalam menciptakan dan menyesuaikan solusi untuk kebutuhan data AI klien yang sering kali khusus. Jadi, saya bekerja erat dengan mereka untuk menetapkan agenda itu.

Tentu saja, ada juga perencanaan strategis tahunan dan kuartalan, dan memecah objek strategis menjadi tujuan tim individu serta memantau perkembangan sepanjang rencana itu. Mengenai pengembangan fitur yang kita lakukan, kita umumnya memiliki dua jalur teknologi. Satu adalah memastikan kita memiliki potongan yang tepat untuk menghasilkan hasil terbaik pada proyek saat ini dan proyek baru yang masuk. Jalur lainnya adalah meningkatkan dan memperluas kemampuan teknologi kita, dengan fokus pada mengintegrasikan pembelajaran mesin ke dalamnya.

Bisakah Anda membahas jenis algoritma pembelajaran mesin yang Anda kerjakan di LXT?

Solusi AI sedang mengubah bisnis di seluruh industri, dan kami di LXT merasa terhormat untuk menyediakan data berkualitas tinggi untuk melatih algoritma pembelajaran mesin yang memungkinkan mereka. Klien kami bekerja pada berbagai aplikasi, termasuk realitas tambah dan virtual, penglihatan komputer, AI konversasional, AI generatif, relevansi pencarian, dan pengolahan suara serta bahasa alami (NLP), di antara lainnya. Kami berdedikasi untuk memberdayakan algoritma pembelajaran mesin dan teknologi masa depan melalui generasi dan peningkatan data di seluruh bahasa, budaya, dan modality.

Secara internal, kami juga mengintegrasikan pembelajaran mesin untuk meningkatkan dan mengoptimalkan proses internal kami, mulai dari mengotomatisasi validasi kualitas data kami, hingga memungkinkan model pelabelan berbasis manusia di seluruh modality data yang kami kerjakan.

Pengolahan suara dan audio sedang mendekati kesempurnaan ketika datang ke bahasa Inggris dan khususnya pria kulit putih. Berapa lama Anda perkirakan sampai menjadi lapangan yang setara di semua bahasa, jenis kelamin, dan etnis?

Pertanyaan ini rumit, dan tergantung pada sejumlah faktor, termasuk ekonomi, politik, sosial, dan teknologi, di antara lainnya. Tapi yang jelas adalah bahwa dominasi bahasa Inggrislah yang mengantarkan AI ke titik di mana kita berada sekarang. Jadi untuk mencapai tempat di mana itu menjadi lapangan yang setara, benar-benar tergantung pada kecepatan di mana representasi data dari berbagai etnis dan populasi tumbuh secara online, dan kecepatan di mana itu tumbuh adalah yang akan menentukan kapan kita mencapai titik itu.

Namun, LXT dan perusahaan serupa dapat memiliki peran besar dalam mendorong kita menuju lapangan yang lebih setara. Selama data untuk bahasa, jenis kelamin, dan etnis yang kurang terwakili sulit diakses atau tidak tersedia, perubahan itu akan datang lebih lambat. Tapi kami berusaha melakukan bagian kami. Dengan cakupan untuk lebih dari 1.000 lokasi bahasa dan pengalaman di 145 negara, LXT membantu memungkinkan akses ke lebih banyak data bahasa.

Apa visi Anda tentang bagaimana LXT dapat mempercepat upaya AI untuk klien yang berbeda?

Tujuan kami di LXT adalah menyediakan solusi data yang memungkinkan pengembangan AI yang efisien, akurat, dan lebih cepat. Melalui 12 tahun pengalaman kami di ruang data AI, tidak hanya kami mengumpulkan pengetahuan luas tentang kebutuhan klien dalam semua aspek yang terkait dengan data, tetapi kami juga terus memperbarui proses kami untuk menghasilkan data berkualitas tertinggi dengan kecepatan dan harga terbaik. Sebagai hasil dari komitmen kami yang kuat untuk menyediakan klien kami dengan kombinasi optimal dari kualitas data AI, efisiensi, dan harga, kami telah menjadi mitra data AI yang tepercaya, seperti yang terlihat dari klien yang berulang kali kembali ke LXT untuk kebutuhan data AI yang terus berkembang dan berevolusi. Visi saya adalah untuk memperkuat, meningkatkan, dan memperluas “cara” LXT itu ke semua modality data yang kami kerjakan serta ke semua jenis pengembangan AI yang kami layani sekarang, termasuk AI generatif. Mencapai tujuan ini berputar di sekitar strategis memperluas kemampuan pembelajaran mesin dan ilmu data kami, baik dalam hal teknologi maupun sumber daya. Terima kasih atas wawancara yang luar biasa, pembaca yang ingin mempelajari lebih lanjut harus mengunjungi LXT.

Antoine adalah seorang pemimpin visioner dan rekan pendiri Unite.AI, yang dipandu oleh semangat tak tergoyahkan untuk membentuk dan mempromosikan masa depan AI dan robotika. Sebagai seorang wirausaha serial, ia percaya bahwa AI akan menjadi sangat mengganggu masyarakat seperti listrik, dan sering tertangkap berbicara tentang potensi teknologi disruptif dan AGI.

Sebagai seorang futuris, ia berdedikasi untuk mengeksplorasi bagaimana inovasi ini akan membentuk dunia kita. Selain itu, ia adalah pendiri Securities.io, sebuah platform yang berfokus pada investasi di teknologi-teknologi canggih yang mendefinisikan kembali masa depan dan membentuk kembali seluruh sektor.