Wawancara
Steven Hillion, Wakil Presiden Data dan AI di Astronomer – Seri Wawancara

Steven Hillion adalah Wakil Presiden Data dan AI di Astronomer, di mana ia memanfaatkan latar belakang akademisnya yang luas dalam penelitian matematika dan lebih dari 15 tahun pengalaman dalam pengembangan platform pembelajaran mesin di Lembah Silikon. Di Astronomer, ia memimpin penciptaan fitur Apache Airflow yang dirancang khusus untuk tim ML dan AI dan mengawasi tim ilmu data internal. Di bawah kepemimpinannya, Astronomer telah memajukan platform orkestrasi data modernnya, secara signifikan meningkatkan kemampuan pipa data untuk mendukung berbagai sumber data dan tugas melalui pembelajaran mesin.
Apakah Anda bisa berbagi beberapa informasi tentang perjalanan Anda di ilmu data dan AI, dan bagaimana itu telah membentuk pendekatan Anda dalam memimpin tim insinyur dan analitik?
Saya memiliki latar belakang dalam matematika penelitian di Berkeley sebelum saya pindah ke Lembah Silikon dan bekerja sebagai insinyur di beberapa perusahaan rintisan yang sukses. Saya senang meninggalkan politik dan birokrasi akademis, tetapi saya menemukan bahwa dalam beberapa tahun saya merindukan matematika. Jadi saya beralih ke pengembangan platform untuk pembelajaran mesin dan analitik, dan itu hampir semua yang saya lakukan sejak saat itu.
Pelatihan saya dalam matematika murni telah menghasilkan preferensi untuk apa yang disebut ilmuwan data sebagai ‘parsimoni’ — alat yang tepat untuk pekerjaan, dan tidak lebih. Karena matematikawan cenderung memfavoritkan solusi yang elegan daripada mesin yang kompleks, saya selalu mencoba menekankan kesederhanaan saat menerapkan pembelajaran mesin pada masalah bisnis. Pembelajaran mesin yang dalam sangat baik untuk beberapa aplikasi — model bahasa besar sangat brilian untuk meringkas dokumen, misalnya — tetapi terkadang model regresi sederhana lebih sesuai dan lebih mudah dijelaskan.
Sangat menarik untuk melihat peran yang bergeser dari ilmuwan data dan insinyur perangkat lunak dalam dua dekade terakhir sejak pembelajaran mesin menjadi luas. Setelah mengenakan kedua topi, saya sangat menyadari pentingnya siklus pengembangan perangkat lunak (terutama otomatisasi dan pengujian) yang diterapkan pada proyek pembelajaran mesin.
Apa tantangan terbesar dalam memindahkan, memproses, dan menganalisis data tidak terstruktur untuk AI dan model bahasa besar (LLM)?
Di dunia AI Generatif, data Anda adalah aset paling berharga. Model-model tersebut semakin komoditas, sehingga diferensiasi Anda adalah semua pengetahuan lembaga yang keras diperoleh dan dikurasi dalam dataset propietaris dan dikurasi Anda.
Menyampaikan data yang tepat pada waktu yang tepat menempatkan tuntutan tinggi pada pipa data Anda — dan ini berlaku untuk data tidak terstruktur sama seperti data terstruktur, atau mungkin lebih. Seringkali Anda mengingest data dari banyak sumber yang berbeda, dalam format yang berbeda. Anda perlu akses ke berbagai metode untuk membuka data dan membuatnya siap untuk digunakan dalam inferensi model atau pelatihan model. Anda juga perlu memahami provenance data, dan di mana ia berakhir untuk “menunjukkan pekerjaan Anda”.
Jika Anda hanya melakukannya sekali-sekali untuk melatih model, itu tidak masalah. Anda tidak perlu mengoperasionalkannya. Jika Anda menggunakan model setiap hari, untuk memahami sentimen pelanggan dari forum online, atau untuk meringkas dan mengarahkan faktur, maka itu mulai terlihat seperti pipa data operasional lainnya, yang berarti Anda perlu memikirkan tentang keandalan dan reproducibility. Atau jika Anda sering memperbarui model, maka Anda perlu khawatir tentang pemantauan akurasi dan biaya.
Berita baiknya adalah insinyur data telah mengembangkan platform yang hebat, Airflow, untuk mengelola pipa data, yang telah diterapkan secara sukses untuk mengelola penerapan model dan pemantauan oleh beberapa tim ML paling canggih di dunia. Jadi model-model tersebut mungkin baru, tetapi orkestrasi tidak.
Apakah Anda bisa menjelaskan tentang penggunaan data sintetis untuk memperhalus model yang lebih kecil untuk akurasi? Bagaimana ini dibandingkan dengan melatih model yang lebih besar?
Ini adalah teknik yang kuat. Anda bisa memikirkan model bahasa besar terbaik sebagai beberapa cara mengabadikan apa yang telah mereka pelajari tentang dunia, dan mereka bisa meneruskannya ke model yang lebih kecil dengan menghasilkan data sintetis. Model-model LLM mengabadikan sejumlah besar pengetahuan yang dipelajari dari pelatihan ekstensif pada dataset yang beragam. Model-model ini dapat menghasilkan data sintetis yang menangkap pola, struktur, dan informasi yang telah mereka pelajari. Data sintetis ini kemudian dapat digunakan untuk melatih model yang lebih kecil, secara efektif mentransfer beberapa pengetahuan dari model yang lebih besar ke model yang lebih kecil. Proses ini sering disebut “penyulingan pengetahuan” dan membantu dalam menciptakan model yang efisien, lebih kecil yang masih berkinerja baik pada tugas tertentu. Dan dengan data sintetis kemudian Anda bisa menghindari masalah privasi, dan mengisi celah dalam data pelatihan yang kecil atau tidak lengkap.
Ini bisa berguna untuk melatih model AI generatif yang lebih spesifik domain, dan bahkan bisa lebih efektif daripada melatih model “lebih besar”, dengan tingkat kontrol yang lebih besar.
Ilmuwan data telah menghasilkan data sintetis selama beberapa waktu dan imputasi telah ada sejak dataset yang kacau ada. Tetapi Anda selalu harus sangat berhati-hati bahwa Anda tidak memperkenalkan bias, atau membuat asumsi yang tidak tepat tentang distribusi data. Sekarang bahwa mensintesis data menjadi sangat mudah dan kuat, Anda harus lebih berhati-hati. Kesalahan dapat diperbesar.
Kurangnya keanekaragaman dalam data yang dihasilkan dapat menyebabkan ‘keruntuhan model’. Model tersebut berpikir bahwa ia melakukan dengan baik, tetapi itu karena ia belum melihat gambaran lengkap. Dan, lebih umum, kurangnya keanekaragaman dalam data pelatihan adalah sesuatu yang tim data harus selalu waspadai.
Pada tingkat dasar, apakah Anda menggunakan data sintetis atau data organik, garis keturunan dan kualitas adalah sangat penting untuk melatih atau memperhalus model. Seperti yang kita ketahui, model hanya sebaik data yang mereka latih. Sementara data sintetis bisa menjadi alat yang hebat untuk membantu mewakili dataset sensitif tanpa memaparkannya atau mengisi celah yang mungkin ditinggalkan dari dataset yang representatif, Anda harus memiliki jejak kertas yang menunjukkan dari mana data berasal dan dapat membuktikan tingkat kualitasnya.
Apa beberapa teknik inovatif yang tim Anda di Astronomer implementasikan untuk meningkatkan efisiensi dan keandalan pipa data?
Banyak! Infrastruktur Airflow yang sepenuhnya dikelola oleh Astro dan Astro Hypervisor mendukung penskalaan dinamis dan pemantauan proaktif melalui metrik kesehatan yang canggih. Ini memastikan bahwa sumber daya digunakan secara efisien dan bahwa sistem dapat diandalkan pada skala apa pun. Astro menyediakan peringatan yang kuat dan terpusat dengan notifikasi yang dapat disesuaikan yang dapat dikirim melalui berbagai saluran seperti Slack dan PagerDuty. Ini memastikan intervensi tepat waktu sebelum masalah eskalasi.
Test validasi data, test unit, dan periksa kualitas data memainkan peran vital dalam memastikan keandalan, akurasi, dan efisiensi pipa data dan akhirnya data yang menggerakkan bisnis Anda. Periksa ini memastikan bahwa saat Anda dengan cepat membangun pipa data untuk memenuhi tenggat waktu, mereka secara aktif menangkap kesalahan, memperbaiki waktu pengembangan, dan mengurangi kesalahan yang tidak terduga di latar belakang. Di Astronomer, kami telah membangun alat seperti Astro CLI untuk membantu memeriksa fungsi kode atau mengidentifikasi masalah integrasi dalam pipa data Anda.
Bagaimana Anda melihat evolusi tata kelola AI generatif, dan apa langkah-langkah yang harus diambil untuk mendukung penciptaan alat lebih lanjut?
Tata kelola sangat penting jika aplikasi AI Generatif akan sukses. Ini semua tentang transparansi dan reproducibility. Apakah Anda tahu bagaimana Anda mendapatkan hasil ini, dan dari mana, dan oleh siapa? Airflow itu sendiri sudah memberikan cara untuk melihat apa yang dilakukan oleh pipa data individual. Antarmukanya adalah salah satu alasan adopsi yang cepat pada awalnya, dan di Astronomer kami telah melengkapi itu dengan visibilitas di seluruh tim dan penerapan. Kami juga menyediakan pelanggan kami dengan Dasbor Pelaporan yang menawarkan wawasan komprehensif tentang penggunaan platform, kinerja, dan atribusi biaya untuk pengambilan keputusan yang tepat. Selain itu, API Astro memungkinkan tim untuk mengirimkan, mengotomatisasi, dan mengelola pipa Airflow mereka secara terprogram, memitigasi risiko yang terkait dengan proses manual, dan memastikan operasi yang lancar pada skala besar saat mengelola beberapa lingkungan Airflow. Kemampuan garis keturunan dimasukkan ke dalam platform.
Ini semua langkah-langkah menuju membantu mengelola tata kelola data, dan saya percaya perusahaan dari semua ukuran mengakui pentingnya tata kelola data untuk memastikan kepercayaan dalam aplikasi AI. Pengakuan dan kesadaran ini akan sebagian besar mengarahkan permintaan alat tata kelola data, dan saya antisipasi penciptaan alat lebih lanjut akan mempercepat seiring AI generatif berkembang. Tetapi mereka perlu menjadi bagian dari tumpukan orkestrasi yang lebih besar, yang mengapa kami memandangnya sebagai fundamental untuk cara kami membangun platform kami.
Apakah Anda bisa memberikan contoh tentang bagaimana solusi Astronomer telah meningkatkan efisiensi operasional dan produktivitas untuk klien?
Proses AI Generatif melibatkan tugas yang kompleks dan intensif sumber daya yang perlu dioptimalkan dan dijalankan berulang-ulang. Astro, platform Airflow yang dikelola oleh Astronomer, menyediakan kerangka di pusat tumpukan aplikasi AI yang muncul untuk membantu menyederhanakan tugas-tugas ini dan meningkatkan kemampuan untuk berinovasi dengan cepat.
Dengan mengatur tugas AI Generatif, bisnis dapat memastikan bahwa sumber daya komputasi digunakan secara efisien dan alur kerja dioptimalkan dan disesuaikan secara real-time. Ini sangat penting dalam lingkungan di mana model generatif harus diperbarui atau dilatih kembali berdasarkan data baru.
Dengan memanfaatkan manajemen alur kerja Airflow dan kemampuan penerapan dan penskalaan Astronomer, tim dapat menghabiskan lebih sedikit waktu untuk mengelola infrastruktur dan fokus perhatian mereka pada transformasi data dan pengembangan model, yang mempercepat penerapan aplikasi AI Generatif dan meningkatkan kinerja.
Dengan cara ini, platform Astro Astronomer telah membantu pelanggan meningkatkan efisiensi operasional AI Generatif di berbagai kasus penggunaan. Untuk menyebutkan beberapa, kasus penggunaan termasuk penemuan produk e-niaga, analisis risiko churn pelanggan, otomatisasi dukungan, klasifikasi dan ringkasan dokumen hukum, memperoleh wawasan produk dari ulasan pelanggan, dan penyediaan cluster dinamis untuk generasi gambar produk.
Apa peran Astronomer dalam meningkatkan kinerja dan skalabilitas aplikasi AI dan ML?
Skalabilitas adalah tantangan besar bagi bisnis yang memanfaatkan AI Generatif pada 2024. Ketika beralih dari prototipe ke produksi, pengguna mengharapkan aplikasi AI Generatif mereka untuk dapat diandalkan dan berkinerja, dan untuk output yang dihasilkan untuk dapat dipercaya. Ini perlu dilakukan dengan biaya yang efektif dan bisnis dari semua ukuran perlu dapat memanfaatkan potensinya. Dengan menggunakan Astronomer, tugas dapat diskalakan secara horizontal untuk memproses sejumlah besar sumber data. Astro dapat menskalakan penerapan dan cluster yang menjadi tuan rumah, dan eksekusi tugas berbasis antrian dengan jenis mesin yang didedikasikan menyediakan keandalan yang lebih besar dan penggunaan sumber daya komputasi yang efisien. Untuk membantu dengan potongan puzzle biaya, Astro menawarkan fitur penskalaan hingga nol dan hibernasi, yang membantu mengontrol biaya yang melambung dan mengurangi pengeluaran awan. Kami juga menyediakan transparansi lengkap tentang biaya platform. Tim data saya menghasilkan laporan tentang konsumsi yang kami buat tersedia setiap hari untuk pelanggan kami.
Apa beberapa tren masa depan dalam AI dan ilmu data yang Anda antisipasi, dan bagaimana Astronomer mempersiapkan diri untuk mereka?
AI yang dapat dijelaskan adalah area pengembangan yang sangat penting dan menarik. Menjadi mampu melihat ke dalam kerja internal model yang sangat besar hampir menakutkan. Dan saya juga tertarik untuk melihat bagaimana komunitas bergumul dengan dampak lingkungan dari pelatihan dan penyetelan model. Di Astronomer, kami terus memperbarui Registry kami dengan semua integrasi terbaru, sehingga tim data dan ML dapat terhubung ke layanan model terbaik dan platform komputasi yang paling efisien tanpa harus melakukan pekerjaan berat.
Bagaimana Anda membayangkan integrasi alat AI canggih seperti LLM dengan sistem manajemen data tradisional berkembang selama beberapa tahun mendatang?
Kami telah melihat Databricks dan Snowflake mengumumkan tentang bagaimana mereka mengintegrasikan penggunaan dan pengembangan LLM dalam platform mereka masing-masing. Platform DBMS dan ML lainnya akan melakukan hal yang sama. Ini sangat menyenangkan untuk melihat insinyur data memiliki akses mudah ke metode yang sangat kuat, langsung dari baris perintah atau prompt SQL.
Saya sangat tertarik dengan bagaimana basis data relasional mengintegrasikan pembelajaran mesin. Saya selalu menunggu metode ML untuk dimasukkan ke dalam standar SQL, tetapi untuk beberapa alasan, dua disiplin ilmu ini tidak pernah benar-benar cocok. Mungkin kali ini akan berbeda.
Saya sangat bersemangat tentang masa depan model bahasa besar untuk membantu pekerjaan insinyur data. Untuk memulai, model LLM telah sangat sukses dengan generasi kode, walaupun upaya awal untuk menyediakan ilmuwan data dengan saran yang digerakkan oleh AI telah bercampur: Hex adalah contoh yang baik, misalnya, sedangkan Snowflake tidak terlalu mengesankan sampai sekarang. Tetapi ada potensi besar untuk mengubah sifat pekerjaan tim data, jauh lebih banyak daripada untuk pengembang. Mengapa? Untuk insinyur perangkat lunak, prompt adalah nama fungsi atau dokumen, tetapi untuk insinyur data ada data juga. Ada konteks yang sangat banyak yang model dapat bekerja sama untuk membuat saran yang berguna dan akurat.
Apa saran yang Anda berikan kepada ilmuwan data dan insinyur AI yang ingin membuat dampak di industri?
Belajar dengan melakukan. Ini sangat mudah untuk membangun aplikasi hari ini, dan untuk melengkapi mereka dengan kecerdasan buatan. Jadi, bangun sesuatu yang keren, dan kirimkan kepada teman dari teman yang bekerja di perusahaan yang Anda kagumi. Atau kirimkan kepada saya, dan saya berjanji akan melihatnya!
Triknya adalah menemukan sesuatu yang Anda minati dan menemukan sumber data yang terkait. Seorang teman saya melakukan analisis yang menarik tentang musim bisbol yang tidak biasa sejak abad ke-19 dan menemukan beberapa cerita yang layak dibuat film. Dan beberapa insinyur Astronomer baru-baru ini berkumpul selama akhir pekan untuk membangun platform untuk pipa data yang dapat memperbaiki diri sendiri. Saya tidak bisa membayangkan mencoba melakukan sesuatu seperti itu beberapa tahun yang lalu, tetapi dengan hanya beberapa hari upaya, kami memenangkan hackathon Cohere dan membangun fondasi fitur baru besar di platform kami. Terima kasih atas wawancara yang luar biasa, pembaca yang ingin mempelajari lebih lanjut harus mengunjungi Astronomer.












