Wawancara

Anais Dotis-Georgiou, Developer Advocate di InfluxData – Seri Wawancara

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Anais Dotis-Georgiou adalah seorang Developer Advocate untuk InfluxData dengan passion untuk membuat data menjadi indah dengan menggunakan Data Analytics, AI, dan Machine Learning. Dia mengambil data yang dia kumpulkan, melakukan penelitian, eksplorasi, dan rekayasa untuk menerjemahkan data menjadi sesuatu yang memiliki fungsi, nilai, dan keindahan. Ketika dia tidak berada di balik layar, Anda dapat menemukannya di luar melakukan menggambar, peregangan, boarding, atau mengejar bola sepak.

InfluxData adalah perusahaan yang membangun InfluxDB, basis data time series sumber terbuka yang digunakan oleh lebih dari satu juta pengembang di seluruh dunia. Misi mereka adalah membantu pengembang membangun sistem cerdas, waktu nyata dengan data time series mereka.

Apakah Anda dapat berbagi sedikit tentang perjalanan Anda dari menjadi Asisten Penelitian hingga menjadi Lead Developer Advocate di InfluxData? Bagaimana latar belakang Anda dalam analisis data dan machine learning membentuk peran Anda saat ini?

Saya mendapatkan gelar sarjana di bidang teknik kimia dengan fokus pada teknik biomedis dan akhirnya bekerja di laboratorium melakukan pengembangan vaksin dan deteksi autisme prenatal. Dari sana, saya mulai memprogram robot penanganan cairan dan membantu ilmuwan data memahami parameter untuk deteksi anomali, yang membuat saya lebih tertarik pada pemrograman.

Saya kemudian menjadi perwakilan pengembangan penjualan di Oracle (ORCL ) dan menyadari bahwa saya benar-benar perlu fokus pada pengkodean. Saya mengikuti boot camp pengkodean di Universitas Texas di bidang analisis data dan dapat memasuki teknologi, khususnya hubungan pengembang.

Saya berasal dari latar belakang teknis, sehingga itu membantu membentuk peran saya saat ini. Meskipun saya tidak memiliki pengalaman pengembangan, saya dapat berhubungan dengan dan berempati dengan orang-orang yang memiliki latar belakang teknik dan pikiran, tetapi juga mencoba belajar perangkat lunak. Jadi, ketika saya membuat konten atau tutorial teknis, saya dapat membantu pengguna baru mengatasi tantangan teknis sambil meletakkan percakapan dalam konteks yang relevan dan menarik bagi mereka.

Pekerjaan Anda tampaknya menggabungkan kreativitas dengan keahlian teknis. Bagaimana Anda menggabungkan passion Anda untuk membuat data ‘indah’ ke dalam pekerjaan harian Anda di InfluxData?

Belakangan ini, saya lebih fokus pada rekayasa data daripada analisis data. Meskipun saya tidak fokus pada analisis data sebanyak yang saya lakukan sebelumnya, saya masih sangat menikmati matematika—saya pikir matematika itu indah, dan akan melompat pada kesempatan untuk menjelaskan matematika di balik algoritma.

InfluxDB telah menjadi tonggak di ruang data time series. Bagaimana Anda melihat komunitas sumber terbuka mempengaruhi pengembangan dan evolusi InfluxDB?

InfluxData sangat berkomitmen pada arsitektur data terbuka dan ekosistem Apache. Tahun lalu kami mengumumkan InfluxDB 3.0, inti baru untuk InfluxDB yang ditulis dalam Rust dan dibangun dengan Apache Flight, DataFusion, Arrow, dan Parquet–apa yang kami sebut sebagai tumpukan FDAP. Ketika insinyur di InfluxData terus berkontribusi pada proyek-proyek hulu, komunitas terus tumbuh dan proyek-proyek Apache Arrow menjadi lebih mudah digunakan dengan lebih banyak fitur dan fungsionalitas, serta interoperabilitas yang lebih luas.

Apa yang paling menarik dari proyek-proyek sumber terbuka atau kontribusi yang Anda lihat baru-baru ini dalam konteks data time series dan AI?

Sangat keren melihat penambahan LLM yang digunakan kembali atau diterapkan pada time series untuk peramalan zero-shot. Autolab memiliki koleksi model bahasa time series terbuka, dan TimeGPT adalah contoh lain yang sangat bagus.

Bagaimana InfluxData memastikan inisiatif sumber terbuka mereka tetap relevan dan bermanfaat bagi komunitas pengembang, terutama dengan kemajuan cepat dalam AI dan machine learning?

Inisiatif InfluxData tetap relevan dan bermanfaat dengan fokus pada kontribusi pada proyek-proyek sumber terbuka yang juga digunakan oleh perusahaan AI. Misalnya, setiap kali InfluxDB berkontribusi pada Apache Arrow, Parquet, atau DataFusion, itu bermanfaat bagi setiap perusahaan AI lain yang juga menggunakan teknologi tersebut, termasuk Apache Spark, DataBricks, Rapids.ai, Snowflake, BigQuery, HuggingFace, dan banyak lagi.

Model bahasa time series menjadi semakin penting dalam analisis prediktif. Bisakah Anda menjelaskan bagaimana model-model ini mengubah peramalan time series dan deteksi anomali?

Model bahasa time series outperform model linier dan statistik sambil juga menyediakan peramalan zero-shot. Ini berarti Anda tidak perlu melatih model pada data Anda sebelum menggunakannya. Tidak ada kebutuhan untuk menyetel model statistik, yang memerlukan keahlian mendalam dalam statistik time series.

Namun, tidak seperti pemrosesan bahasa alami, bidang time series kekurangan dataset besar yang dapat diakses secara publik. Sebagian besar model pra-terlatih untuk time series dilatih pada ukuran sampel kecil, yang hanya berisi beberapa ribu—orang mungkin hanya beberapa ratus—sampel. Meskipun dataset benchmark ini telah instrumental dalam kemajuan komunitas time series, ukuran sampel terbatas dan kurangnya generalisasi menimbulkan tantangan untuk pelatihan model pembelajaran dalam.

Itulah yang saya percaya membuat model bahasa time series sumber terbuka sulit ditemukan. TimesFM Google (GOOGL ) dan Tiny Time Mixers IBM telah dilatih pada dataset besar dengan miliaran data poin. Dengan TimesFM, misalnya, proses pra-pelatihan dilakukan menggunakan Google Cloud TPU v3–256, yang terdiri dari 256 inti TPU dengan total 2 terabyte memori. Proses pra-pelatihan memakan waktu sekitar sepuluh hari dan menghasilkan model dengan 1,2 miliar parameter. Model pra-terlatih kemudian diperhalus pada tugas dan dataset spesifik dengan tingkat pembelajaran yang lebih rendah dan lebih sedikit epoch.

Saya harap transformasi ini berarti bahwa lebih banyak orang dapat membuat prediksi akurat tanpa pengetahuan domain yang mendalam. Namun, membutuhkan banyak pekerjaan untuk menimbang kelebihan dan kekurangan menggunakan model komputasi mahal seperti model bahasa time series dari perspektif biaya keuangan dan lingkungan.

Posting blog Hugging Face ini detail contoh lain yang sangat bagus tentang peramalan time series.

Apa kelebihan utama menggunakan model bahasa time series daripada metode tradisional, terutama dalam menangani pola kompleks dan kinerja zero-shot?

Kelebihan kritis adalah tidak perlu melatih dan melatih kembali model pada data time series Anda. Ini berharap dapat menghilangkan masalah pembelajaran mesin online untuk memantau drift model Anda dan memicu pelatihan ulang, idealnya menghilangkan kompleksitas pipa peramalan Anda.

Anda juga tidak perlu berjuang untuk memperkirakan korelasi antar seri atau hubungan untuk model statistik multivariat. Varians tambahan yang ditambahkan oleh perkiraan sering merusak peramalan yang dihasilkan dan dapat menyebabkan model belajar korelasi semu.

Bisakah Anda memberikan contoh praktis tentang bagaimana model seperti TimesFM Google, TinyTimeMixer IBM, dan MOMENT Autolab telah diterapkan dalam skenario dunia nyata?

Sulit untuk menjawab; karena model-model ini masih dalam masa bayi, sedikit yang diketahui tentang bagaimana perusahaan menggunakan mereka dalam skenario dunia nyata.

Dalam pengalaman Anda, apa tantangan yang biasanya dihadapi organisasi ketika mengintegrasikan model bahasa time series ke dalam infrastruktur data yang ada, dan bagaimana mereka dapat mengatasi tantangan tersebut?

Model bahasa time series sangat baru sehingga saya tidak tahu tantangan spesifik yang dihadapi organisasi. Namun, saya membayangkan mereka akan menghadapi tantangan yang sama yang dihadapi ketika mengintegrasikan model GenAI ke dalam pipa data. Tantangan tersebut termasuk:

  • Isu kompatibilitas dan integrasi data: Model bahasa time series sering memerlukan format data spesifik, pengaturan waktu yang konsisten, dan interval reguler, tetapi infrastruktur data yang ada mungkin termasuk data time series yang tidak terstruktur atau tidak konsisten yang tersebar di berbagai sistem, seperti database warisan, penyimpanan cloud, atau aliran waktu nyata. Untuk mengatasi ini, tim harus mengimplementasikan pipa ETL (ekstrak, transformasi, muat) yang kuat untuk memproses, membersihkan, dan menyelaraskan data time series.
  • Kinerja dan skalabilitas model: Model bahasa time series, terutama model pembelajaran dalam seperti transformer, dapat memerlukan sumber daya yang intensif, memerlukan sumber daya komputasi dan memori yang signifikan untuk memproses volume besar data time series dalam waktu nyata atau hampir waktu nyata. Ini akan memerlukan tim untuk mengirimkan model pada platform yang dapat diskalakan seperti Kubernetes atau layanan ML yang dikelola cloud, memanfaatkan percepatan GPU jika perlu, dan menggunakan kerangka kerja pemrosesan terdistribusi seperti Dask atau Ray untuk memparalelisasi inferensi model.
  • Interpretasi dan kepercayaan: Model time series, terutama model LM yang kompleks, dapat dianggap sebagai “black box”, membuatnya sulit untuk menafsirkan prediksi. Ini dapat menjadi masalah khusus dalam industri yang diatur seperti keuangan atau perawatan kesehatan.
  • Keamanan dan privasi data: Menangani data time series sering melibatkan informasi sensitif, seperti data sensor IoT atau transaksi keuangan, sehingga memastikan keamanan data dan kepatuhan sangat penting ketika mengintegrasikan model LM. Organisasi harus memastikan pipa data dan model mereka mematuhi praktik keamanan terbaik, termasuk enkripsi dan kontrol akses, dan mengirimkan model dalam lingkungan yang aman dan terisolasi.

Menghadap ke depan, bagaimana Anda membayangkan peran model bahasa time series berkembang dalam bidang analisis prediktif dan AI? Apakah ada tren atau teknologi yang sedang muncul yang khusus menarik bagi Anda?

Langkah berikutnya yang mungkin dalam evolusi model bahasa time series bisa jadi memperkenalkan alat yang memungkinkan pengguna untuk mengirim, mengakses, dan menggunakan model tersebut dengan lebih mudah. Banyak model bahasa time series yang saya gunakan memerlukan lingkungan yang sangat spesifik dan kekurangan cakupan tutorial dan dokumentasi. Pada akhirnya, proyek-proyek ini masih dalam tahap awal, tetapi akan menarik untuk melihat bagaimana mereka berkembang dalam beberapa bulan dan tahun mendatang. Saya telah menggunakan beberapa proyek yang memerlukan lingkungan yang sangat spesifik dan kekurangan cakupan tutorial dan dokumentasi. Pada akhirnya, proyek-proyek ini masih dalam tahap awal, tetapi akan menarik untuk melihat bagaimana mereka berkembang dalam beberapa bulan dan tahun mendatang.

Terima kasih atas wawancara yang luar biasa, pembaca yang ingin mempelajari lebih lanjut dapat mengunjungi InfluxData.

Antoine adalah seorang pemimpin visioner dan rekan pendiri Unite.AI, yang dipandu oleh semangat tak tergoyahkan untuk membentuk dan mempromosikan masa depan AI dan robotika. Sebagai seorang wirausaha serial, ia percaya bahwa AI akan menjadi sangat mengganggu masyarakat seperti listrik, dan sering tertangkap berbicara tentang potensi teknologi disruptif dan AGI.

Sebagai seorang futuris, ia berdedikasi untuk mengeksplorasi bagaimana inovasi ini akan membentuk dunia kita. Selain itu, ia adalah pendiri Securities.io, sebuah platform yang berfokus pada investasi di teknologi-teknologi canggih yang mendefinisikan kembali masa depan dan membentuk kembali seluruh sektor.