💧 Split dulu, baru segalanyaScaling, oversampling, imputasi, seleksi fitur — semua di-fit HANYA pada data latih. Test set harus “belum lahir”.
💧 Fitur harus tersedia saat prediksiTanyakan untuk tiap fitur: “apakah nilai ini sudah ada SEBELUM keputusan dibuat?” Kalau tidak → target leakage.
📏 Model jarak wajib scalingKNN, SVM, K-Means, NN butuh standardisasi. Pohon & forest kebal — mereka membandingkan, bukan mengukur jarak.
📈 Baca learning curve duluGap besar train-test = tambah data membantu. Keduanya buruk & rapat = ganti model/fitur, data baru sia-sia.
🎯 Waspadai skor terlalu indahAkurasi 99% hampir selalu berarti leakage, duplikat, atau imbalance — bukan kejeniusan Anda.
🔀 Korelasi ≠ kausalitasSelalu tanya “apakah ada variabel ketiga (confounder)?” sebelum menyimpulkan arah tren.