Dasar-dasar AI
Apa Itu Regresi Linear?
Regresi linear memodelkan target kontinu sebagai kombinasi linear dari satu atau lebih fitur input. Ini digunakan untuk prediksi, estimasi, dan sebagai baseline yang transparan untuk memahami apakah model yang lebih rumit menambah nilai yang berarti.
Kata variabel independen dan variabel dependen menggambarkan peran dalam model, bukan sebab-akibat yang terbukti. Regresi dapat mengidentifikasi sebuah asosiasi sementara faktor pengacau, bias seleksi, kausalitas terbalik, atau kesalahan pengukuran menjelaskan hubungan tersebut.
Poin Penting
- Target y dimodelkan dari fitur input X; versi artikel sebelumnya membalikkan label ini dalam satu penjelasan rumus.
- Metode kuadrat terkecil (OLS) meminimalkan jumlah kuadrat residual.
- Diagnostik residual dan asumsi penting untuk inferensi dan ketidakpastian.
- Regularisasi ridge dan lasso membantu ketika prediktor banyak atau berkorelasi.

Regresi Linear Sederhana
Dengan satu fitur, modelnya adalah:
ŷ = β₀ + β₁x
β₀ adalah intercept dan β₁ adalah slope. Residual untuk observasi i adalah yᵢ - ŷᵢ. Metode kuadrat terkecil (OLS) memilih koefisien yang meminimalkan jumlah kuadrat residual.
Slope memperkirakan perubahan harapan pada target yang terkait dengan perubahan satu unit pada fitur dalam model yang dipasang. Tidak boleh digambarkan sebagai efek kausal kecuali desain studi dan asumsi mendukung identifikasi kausal.
Regresi Linear Berganda
Dengan p fitur:
ŷ = β₀ + β₁x₁ + β₂x₂ + … + βₚxₚ
Setiap koefisien diinterpretasikan secara kondisional pada fitur lain yang termasuk. Regresi berganda dapat menggabungkan variabel kategorikal melalui encoding, istilah polinomial, dan interaksi. Model tetap “linear” karena linear pada koefisien, meskipun fitur yang ditransformasi seperti x² disertakan.
Asumsi dan Diagnostik
Untuk prediksi, pertanyaan utama adalah seberapa baik model dapat digeneralisasikan. Untuk uji koefisien klasik dan interval, asumsi tambahan menjadi penting:
- Linearitas: rata‑rata kondisional direpresentasikan oleh bentuk linear yang dipilih.
- Kesalahan independen atau dimodelkan dengan benar: observasi berulang, berkelompok, spasial, atau deret waktu mungkin memerlukan struktur kesalahan yang berbeda.
- Varians kesalahan konstan: heteroskedastisitas memengaruhi standar error dan estimasi ketidakpastian.
- Multikolinearitas terbatas: prediktor yang sangat berkorelasi membuat koefisien individual tidak stabil.
- Distribusi residual: normalitas relevan untuk beberapa inferensi sampel kecil, bukan keharusan bahwa setiap fitur berdistribusi normal.
Plot residual, ukuran leverage dan pengaruh, serta tinjauan domain dapat mengidentifikasi outlier, non‑linearitas, varians yang berubah, atau observasi yang mendominasi penyesuaian.
Mengevaluasi Prediksi
- Mean absolute error (MAE) rata‑rata ukuran residual absolut.
- Mean squared error (MSE) memberi bobot lebih besar pada kesalahan yang lebih besar.
- Root mean squared error (RMSE) mengembalikan kesalahan kuadrat ke satuan target.
- R² membandingkan variasi residual dengan baseline konstan pada data yang dievaluasi.
R² bukan ukuran akurasi, tidak menetapkan kausalitas, dan dapat menjadi negatif pada data yang dipisahkan. Validasi harus mencerminkan kondisi prediksi sebenarnya, termasuk pemisahan berdasarkan waktu atau grup bila diperlukan.
Ridge, Lasso, dan Elastic Net
Ridge regression menambahkan penalti L2 yang mengecilkan koefisien dan menstabilkan prediktor yang berkorelasi. Lasso menambahkan penalti L1 dan dapat menetapkan koefisien menjadi nol. Elastic net menggabungkan keduanya. Fitur biasanya memerlukan skala yang kompatibel sebelum penalti ini dibandingkan.
Regularisasi memperkenalkan bias sebagai pertukaran untuk varians yang lebih rendah dan dapat mengurangi overfitting. Kekuatan penalti dipilih dengan validasi, bukan set tes akhir.
Ketika Regresi Linear Bukan Alat yang Tepat
Model linear dapat gagal ketika hubungan sangat non‑linear, kesalahan bergantung pada nilai masa lalu, distribusi target memerlukan pemodelan khusus, atau beberapa outlier mendominasi kerugian kuadrat. Pohon keputusan, model linear umum, model deret waktu, regresi robust, atau metode non‑linear mungkin lebih cocok.
Bahkan ketika model kompleks lebih unggul, regresi linear tetap menjadi baseline yang berharga. Jika sistem besar tidak dapat mengunggulinya secara andal, kompleksitas tambahan mungkin tidak terjustifikasi.
Asumsi Model, Estimasi, dan Diagnostik
Regresi linear memodelkan rata‑rata kondisional dari hasil numerik sebagai intercept ditambah prediktor berbobot. Metode kuadrat terkecil memilih koefisien yang meminimalkan residual kuadrat. Koefisien menggambarkan perubahan harapan hasil untuk perubahan satu unit pada prediktor sementara variabel lain yang termasuk dipertahankan konstan, dalam model yang ditentukan. Ini merupakan asosiasi kecuali asumsi identifikasi kausal dan desain studi memberikan justifikasi lebih. Satuan, pengkodean, transformasi, interaksi, dan kategori referensi menentukan interpretasi, sehingga koefisien tanpa kamus data tidak lengkap.
Inferensi klasik bergantung pada asumsi tentang bentuk fungsional, kesalahan independen, varians konstan, dan distribusi kesalahan untuk tes dan interval tertentu. Plot residual versus nilai yang dipasang mengungkapkan non‑linearitas atau heteroskedastisitas; plot Q–Q menilai perilaku ekor; diagnostik leverage dan pengaruh mengidentifikasi observasi yang sangat memengaruhi estimasi. Prediktor yang berkorelasi meningkatkan ketidakpastian dan membuat koefisien individual tidak stabil meskipun prediksi tetap memadai. Standar error yang robust, transformasi, spline, struktur hierarkis, atau model lain mungkin diperlukan daripada menghapus titik data yang tidak nyaman.
Regularisasi, Evaluasi, dan Penggunaan yang Bertanggung Jawab
Ridge regression mengecilkan koefisien dengan penalti L2, sementara lasso dapat menetapkan beberapa koefisien menjadi nol dengan penalti L1; elastic net menggabungkan keduanya. Standarisasi prediktor ketika skala penalti harus sebanding dan pilih kekuatan menggunakan validasi atau cross‑validation. Evaluasi mean absolute error, root mean squared error, distribusi residual, kalibrasi lintas rentang, dan ketidakpastian, dengan pemisahan waktu atau grup yang mencerminkan penggunaan. Bandingkan dengan baseline rata‑rata dan alternatif non‑linear, tetapi pertahankan model linear ketika transparansi dan stabilitas bernilai.
Ekstrapolasi di luar rentang prediktor yang diamati mengikuti garis yang dipasang tanpa bukti dan dapat berbahaya. Pantau rentang fitur, data yang hilang, residual, dan kesalahan subgrup dalam produksi. Interval prediksi menggambarkan ketidakpastian hasil individual dan lebih lebar daripada interval kepercayaan untuk rata‑rata; keduanya memerlukan asumsi. Hindari mengontrol variabel yang memperkenalkan bias kausal ketika tujuan adalah estimasi efek. Regresi linear adalah alat yang tepat untuk hubungan yang terdefinisi, bukan jaminan universal bahwa dunia bersifat linear atau bahwa koefisien mewakili intervensi.
Contoh Praktis: Memperkirakan Waktu Pengiriman
Tim logistik memodelkan durasi pengiriman berdasarkan jarak, tingkat layanan, wilayah, hari kerja, dan cuaca yang diketahui. Mereka memeriksa pola residual non‑linear dan menambahkan spline serta interaksi yang dibenarkan alih‑alih memperlakukan persamaan linear sebagai fisika harfiah. Kelompok carrier dan rute menentukan lipatan validasi. Mean absolute error, tail error, cakupan interval, dan bias sistematis dilaporkan. Pengiriman yang dibatalkan dan data yang dicatat setelah kedatangan dikecualikan atau dimodelkan secara eksplisit.
Koefisien didokumentasikan dalam satuan dan diperiksa untuk ketidakstabilan di bawah prediktor yang berkorelasi. Model menolak ekstrapolasi di luar jarak dan rentang wilayah yang divalidasi. Interval prediksi menyertai perkiraan, dan penjadwalan hilir menggunakan ketidakpastiannya. Pemantauan melacak rentang fitur, residual, cakupan interval, dan bias setelah perubahan jaringan. Klaim kausal tentang carrier atau cuaca tidak dibuat dari koefisien prediktif; eksperimen operasional atau identifikasi yang lebih kuat diperlukan untuk mendukung intervensi.
Bukti Implementasi dan Kesiapan Operasional
Keputusan produksi memerlukan lebih dari sekadar demonstrasi yang berhasil. Tentukan pengguna yang dimaksud, lingkungan operasi, input, output, ketergantungan, pemilik, dan konsekuensi dari setiap kegagalan penting. Bangun baseline yang dapat direproduksi dan set evaluasi berversi sebelum penyetelan. Uji kasus biasa, kondisi batas, input yang rusak atau hilang, pergeseran distribusi, gangguan ketergantungan, penyalahgunaan, serta grup atau lingkungan yang paling mungkin kurang terlayani. Ukur kualitas tugas bersama dengan kalibrasi atau ketidakpastian, latensi, throughput, biaya sumber daya, aksesibilitas, privasi, dan keamanan. Catat setiap transformasi dan ambang batas sehingga peninjau independen dapat mereproduksi hasil dan membedakan bukti dari prototipe yang menarik.
Sebelum peluncuran, tetapkan otoritas untuk rilis, pengecualian, perubahan, rollback, dan pensiun. Gunakan peluncuran bertahap, pertahankan fallback yang aman, dan verifikasi pemantauan dengan kegagalan yang sengaja disuntikkan. Telemetri operasional harus mengungkap kualitas input, perilaku output, versi model atau aturan, kesehatan ketergantungan, intervensi manusia, dan hasil yang dikonfirmasi tanpa mengumpulkan data sensitif yang tidak diperlukan. Tentukan ambang batas peringatan dan pemilik respons, kemudian tinjau bukti dunia nyata setelah penerapan alih‑alih mengasumsikan kinerja offline akan bertahan. Evaluasi kembali setiap kali sumber data, pengguna, model, vendor, kebijakan, perangkat keras, atau tujuan berubah. Sistem yang dipelihara juga memerlukan prosedur pemulihan yang terdokumentasi, pembelajaran insiden, penghapusan dan retensi, serta titik yang jelas di mana sistem harus dinonaktifkan atau diganti.
Pertanyaan yang Sering Diajukan
Apakah regresi linear membutuhkan hanya satu variabel input?
Tidak. Regresi sederhana memiliki satu prediktor, sementara regresi linear berganda dapat menggunakan banyak fitur numerik, kategorikal yang di‑encode, yang ditransformasi, dan interaksi.
Dapatkah regresi linear membuktikan kausalitas?
Tidak. Interpretasi kausal memerlukan desain riset yang dapat dipertahankan serta asumsi tentang pengacauan, seleksi, pengukuran, dan intervensi. Koefisien prediktif saja hanya menggambarkan asosiasi dalam model yang dipasang.












