Dasar-dasar AI
Apa itu Ilmu Data?
Ilmu data adalah praktik mengubah data menjadi pengetahuan yang dapat dipertahankan, prediksi, atau keputusan. Ia menggabungkan keahlian domain, statistik, komputasi, rekayasa data, visualisasi, dan komunikasi. Model dapat menjadi bagian dari pekerjaan, tetapi disiplin ini dimulai sebelum pemodelan dan berlanjut setelah penerapan.
Pertanyaan terpenting bukan “Algoritma mana yang harus kita gunakan?” tetapi “Keputusan apa yang kita dukung, bukti apa yang akan menjawabnya, dan bagaimana kita tahu hasilnya tetap berguna?”
Poin-poin utama
- Ilmu data adalah alur kerja bukti end-to-end, bukan sinonim untuk pembelajaran mesin.
- Definisi masalah, pengukuran, dan tata kelola data sering menentukan keberhasilan lebih daripada kompleksitas model.
- Pertanyaan prediktif dan kausal memerlukan asumsi serta desain evaluasi yang berbeda.
- Analisis yang diterapkan memerlukan pemantauan, dokumentasi, dan komunikasi yang sesuai bagi penggunanya.

Mulailah dengan keputusan dan estimand
Suatu proyek harus mengidentifikasi pengguna, keputusan, intervensi, dan biaya kesalahan. Untuk pertanyaan deskriptif, targetnya bisa berupa tingkat atau tren. Untuk prediksi, bisa berupa permintaan masa depan atau risiko. Untuk pertanyaan kausal, estimand menggambarkan efek intervensi yang didefinisikan di bawah asumsi yang dinyatakan.
Tujuan yang samar seperti “menemukan wawasan” membuat evaluasi menjadi tidak mungkin. Tujuan yang dapat diukur menciptakan batasan untuk pengumpulan data dan mencegah analisis meluas ke setiap bidang yang tersedia.
Kumpulkan, tata kelola, dan pahami data
Tim membuat inventarisasi sumber, kepemilikan, persetujuan, retensi, garis keturunan, dan akses. Mereka membedakan data terstruktur dan tidak terstruktur, mendefinisikan unit dan cap waktu, serta memeriksa apakah catatan mewakili populasi dan periode waktu yang dimaksud.
Pembersihan bukan sekadar menghapus baris yang hilang. Itu mencakup penyelesaian duplikat, nilai yang tidak mungkin, ambiguitas label, perubahan skema, sensor, dan penggabungan yang mengubah unit analisis. Setiap transformasi harus dapat direproduksi dan terdokumentasi.
Jelajahi sebelum memodelkan
Analisis eksploratori mempelajari distribusi, kekurangan data, hubungan, dan potensi artefak pengukuran. Visualisasi dapat mengungkap nilai pencilan dan perbedaan subkelompok yang tersembunyi dalam rata‑rata ringkasan. Penjelajahan harus memberi informasi pada hipotesis tanpa disalahartikan sebagai bukti konfirmatori.
Rekayasa fitur, reduksi dimensi, dan pembelajaran representasi dapat meningkatkan pemodelan, tetapi transformasi harus dipasang hanya pada data pelatihan untuk mencegah kebocoran.
Pilih metode sesuai pertanyaan
Estimasi statistik mengkuantifikasi ketidakpastian di sekitar kuantitas yang diminati. Pembelajaran mesin berguna ketika tujuan utama adalah kinerja prediktif pada data baru. Eksperimen dan metode inferensi kausal diperlukan ketika tujuan adalah efek intervensi.
Baseline harus cukup sederhana untuk dipahami. Model yang lebih kompleks harus membuktikan nilai tambahnya melalui kinerja hold‑out yang lebih baik, ketidakpastian yang terkalibrasi, nilai operasional, atau kemampuan yang diperlukan seperti pemrosesan gambar atau bahasa.
Evaluasi, komunikasikan, dan pantau
Evaluasi harus sesuai dengan keputusan. Sebuah classifier mungkin memerlukan presisi, recall, kalibrasi, dan analisis subkelompok daripada sekadar akurasi; sistem peramalan membutuhkan backtesting yang memperhatikan waktu. Overfitting dan kebocoran adalah kegagalan proses, bukan hanya sifat model.
Komunikasi mencakup asumsi, ketidakpastian, keterbatasan, dan tindakan yang direkomendasikan. Setelah model atau dasbor digunakan, tim memantau kualitas input, pergeseran hasil, perilaku pengguna, dan dampak hilir. Proses keputusan yang dihentikan memerlukan arsip dan kepemilikan yang jelas sebagaimana proses yang diterapkan memerlukan operator.
Siklus hidup ilmu data dan pertanyaan analitis
Ilmu data menggabungkan pengetahuan domain, statistik, komputasi, dan komunikasi untuk mengubah data menjadi bukti bagi keputusan. Mulailah dengan membedakan deskripsi, diagnosis, prediksi, dan inferensi kausal. Dasbor yang melaporkan apa yang terjadi, model yang memprediksi siapa yang akan churn, dan eksperimen yang memperkirakan apakah intervensi mengubah churn menjawab pertanyaan yang berbeda. Definisikan unit, populasi, jendela waktu, hasil, tindakan, dan biaya kesalahan sebelum mengekstrak data. Banyak proyek yang gagal menyelesaikan proksi terukur yang tidak dapat mendukung keputusan yang dimaksud.
Pengakuisisian memerlukan asal usul, izin, desain sampling, dan kontrak data. Penjelajahan memeriksa distribusi, kekurangan data, duplikat, pencilan, hubungan, perubahan pengukuran, dan potensi kebocoran. Pilihan pembersihan adalah asumsi analitis: menghapus baris yang hilang, mengimput nilai, atau membatasi pencilan dapat mengubah populasi dan kesimpulan. Versi data mentah secara tidak dapat diubah dan transformasi sebagai kode, serta buat kamus data dengan unit dan makna. Bagi data evaluasi sebelum mempelajari transformasi atau menguji hipotesis berulang kali.
Pemodelan, inferensi, dan reproduktifitas
Inferensi statistik mengkuantifikasi ketidakpastian di bawah asumsi; pemodelan prediktif memperkirakan kinerja di luar sampel; analisis kausal memerlukan identifikasi melalui desain atau asumsi yang dapat dipertahankan. Pilih metode yang sesuai dengan pertanyaan dan proses pembangkitan data. Bandingkan dengan baseline sederhana, gunakan validasi berkelompok atau yang memperhatikan waktu, dan laporkan ketidakpastian serta sensitivitas. Korelasi tinggi atau pentingnya fitur tidak menetapkan kausalitas. Pengujian berganda, kebebasan derajat peneliti, dan pelaporan selektif dapat menghasilkan pola yang meyakinkan, sehingga pra‑registrasi atau tahap konfirmasi yang jelas terpisah dapat membantu.
Reproduktifitas mencakup kode, lingkungan, snapshot data, seed acak, definisi kueri, dan catatan keputusan manual. Tes otomatis harus mencakup skema, invarian bisnis, transformasi, dan metrik. Notebook berguna untuk eksplorasi tetapi pekerjaan produksi membutuhkan pipeline modular yang dapat ditinjau. Review sejawat harus menantang asumsi, kebocoran, validitas target, dan apakah hasil dapat digeneralisasi. Komunikasikan ukuran efek, ketidakpastian, keterbatasan, dan bukti tandingan daripada hanya signifikansi statistik atau skor model.
Penerapan dan dampak keputusan
Jika analisis menggerakkan proses berulang, tetapkan pemilik, pantau kesegaran data dan kualitas hasil, serta definisikan rollback atau pensiun. Lindungi informasi pribadi dan rahasia melalui minimisasi, kontrol akses, retensi, dan keluaran yang aman. Evaluasi efek subkelompok dan bagaimana pengguna merespons model; umpan balik dapat mengubah data di masa depan. Ukur apakah keputusan meningkatkan tujuan nyata, bukan sekadar apakah model diterapkan. Ilmu data berhasil ketika bukti mengubah tindakan secara andal dan transparan—bukan ketika organisasi mengumpulkan dasbor, fitur, atau eksperimen tanpa kepemilikan.
Contoh kerja: mengukur intervensi retensi
Tim produk mengamati retensi yang lebih rendah dan mendefinisikan pengguna aktif, kohort, jendela, pengecualian, serta keputusan. Analis mengaudit instrumentasi, peristiwa yang hilang, dan campuran akuisisi sebelum pemodelan. Kohort deskriptif mengidentifikasi di mana penurunan terjadi, model prediktif memprioritaskan peserta riset, dan eksperimen onboarding acak memperkirakan apakah perubahan yang diusulkan meningkatkan retensi. Ini adalah tiga analisis berbeda dengan asumsi dan output terpisah.
Notebook, kueri, snapshot data, definisi metrik, dan rencana eksperimen versi dan ditinjau sejawat. Hasil melaporkan ukuran efek dan ketidakpastian dengan batasan untuk permintaan dukungan dan aksesibilitas. Dasbor memantau eksperimen tetapi tidak menggantikan analisis yang telah dideklarasikan sebelumnya. Jika intervensi berhasil, peluncuran tetap bertahap dan memeriksa perilaku jangka panjang. Pekerjaan dianggap berharga hanya jika mendukung keputusan yang dapat direproduksi, bukan karena model kompleks atau grafik yang menarik secara visual dihasilkan.
Bukti implementasi dan kesiapan operasional
Keputusan produksi memerlukan lebih dari demonstrasi yang berhasil. Definisikan pengguna yang dimaksud, lingkungan operasional, masukan, keluaran, ketergantungan, pemilik, dan konsekuensi setiap kegagalan penting. Tetapkan baseline yang dapat direproduksi dan set evaluasi berversi sebelum penyetelan. Uji kasus biasa, kondisi batas, masukan yang rusak atau hilang, pergeseran distribusi, kegagalan ketergantungan, penyalahgunaan, serta kelompok atau lingkungan yang paling mungkin kurang terlayani. Ukur kualitas tugas bersama dengan kalibrasi atau ketidakpastian, latensi, throughput, biaya sumber daya, aksesibilitas, privasi, dan keamanan. Catat setiap transformasi dan ambang batas sehingga peninjau independen dapat mereproduksi hasil dan membedakan bukti dari prototipe menarik.
Sebelum peluncuran, tetapkan otoritas untuk rilis, pengecualian, perubahan, rollback, dan pensiun. Gunakan peluncuran bertahap, pertahankan fallback yang aman, dan verifikasi pemantauan dengan kegagalan yang sengaja disuntikkan. Telemetri operasional harus mengungkap kualitas masukan, perilaku keluaran, versi model atau aturan, kesehatan ketergantungan, intervensi manusia, dan hasil yang dikonfirmasi tanpa mengumpulkan data sensitif yang tidak perlu. Definisikan ambang batas peringatan dan pemilik respons, kemudian tinjau bukti dunia nyata setelah penerapan alih-alih mengasumsikan kinerja offline akan bertahan. Evaluasi kembali setiap kali sumber data, pengguna, model, vendor, kebijakan, perangkat keras, atau tujuan berubah. Sistem yang dipelihara juga memerlukan dokumentasi pemulihan, pembelajaran insiden, prosedur penghapusan dan retensi, serta titik yang jelas di mana harus dinonaktifkan atau diganti.
Pertanyaan yang sering diajukan
Apakah ilmu data sama dengan analitik data?
Istilah tersebut tumpang tindih. Ilmu data sering mencakup pembuatan produk data dan sistem prediktif, sementara analitik mungkin lebih fokus pada dukungan keputusan deskriptif dan diagnostik. Penggunaan organisasi bervariasi.
Apakah setiap proyek ilmu data memerlukan AI?
Tidak. Kuery, grafik, eksperimen, atau estimasi statistik yang dirancang dengan baik dapat lebih berguna dan dapat dipercaya daripada model yang kompleks.












