tugas

Tugas 3: Penerapan Ensemble Learning Menggunakan Algoritma Random Forest

Tugas 3: Penerapan Ensemble Learning Berbasis Random Forest

Eksperimen pemodelan ensemble learning metode Random Forest untuk meningkatkan generalisasi model, mereduksi variansi (variance reduction), dan mengatasi kelemahan instabilitas pohon keputusan tunggal.

1. Prinsip Kerja Ensemble Bagging dan Random Subspace

Random Forest menggabungkan puluhan hingga ratusan pohon keputusan independen yang dilatih menggunakan dua mekanisme pengacakan utama:

  1. Bootstrap Aggregating (Bagging): Setiap pohon dibangun dari sampel acak berukuran NN yang ditarik dengan pengembalian (sampling with replacement) dari dataset latih asli.
  2. Random Feature Subspace: Pada setiap pemisahan simpul (node splitting), hanya sebagian kecil acak dari total MM fitur yang dipertimbangkan (lazimnya m=Mm = \sqrt{M} untuk klasifikasi), memaksa pohon mengeksplorasi fitur-fitur alternatif yang berbeda.
  3. Agregasi Prediksi: Prediksi akhir ditentukan melalui majority voting untuk tugas klasifikasi atau nilai rata-rata (mean average) untuk tugas regresi:
Y^=1Bb=1BTb(x)\hat{Y} = \frac{1}{B} \sum_{b=1}^B T_b(\mathbf{x})

2. Evaluasi Out-of-Bag (OOB) dan Feature Importance

Model dievaluasi menggunakan sampel Out-of-Bag (OOB) sebagai validasi internal tanpa memerlukan pemisahan dataset validasi terpisah. Kepentingan relatif setiap fitur (Mean Decrease Impurity) dihitung untuk mengidentifikasi atribut yang paling berpengaruh terhadap akurasi model.

3. Berkas Tugas Terlampir

  • Jupyter Notebook komprehensif: random-forest-ensemble.ipynb yang memuat tuning hyperparameter n_estimators, max_features, dan grafik peringkat fitur terpenting.