tugas

Tugas 2: Pemodelan Pohon Keputusan (Decision Tree) dan Pengukuran Impuritas

Tugas 2: Pemodelan Klasifikasi Menggunakan Pohon Keputusan (Decision Tree)

Eksplorasi pemodelan klasifikasi terawasi menggunakan algoritma Pohon Keputusan (Decision Tree), mencakup algoritma ID3, C4.5, dan CART untuk membentuk struktur keputusan bercabang yang transparan dan mudah diinterpretasikan.

1. Kriteria Pemilihan Atribut Pemisah (Splitting Criteria)

Pohon keputusan mengevaluasi setiap atribut fitur untuk menentukan batas partisi data terbaik:

  • Entropi Informasi (Entropy):
H(S)=i=1cpilog2piH(S) = -\sum_{i=1}^c p_i \log_2 p_i
  • Information Gain (ID3): Pengurangan entropi setelah partisi dataset berdasarkan atribut AA:
IG(S,A)=H(S)vValues(A)SvSH(Sv)IG(S, A) = H(S) - \sum_{v \in \text{Values}(A)} \frac{|S_v|}{|S|} H(S_v)
  • Gain Ratio (C4.5): Normalisasi Information Gain dengan Split Information untuk mencegah bias pemilihan atribut dengan banyak nilai unik:
GainRatio(S,A)=IG(S,A)SplitInfo(S,A),SplitInfo(S,A)=vSvSlog2SvS\text{GainRatio}(S, A) = \frac{IG(S, A)}{\text{SplitInfo}(S, A)}, \quad \text{SplitInfo}(S, A) = -\sum_{v} \frac{|S_v|}{|S|} \log_2 \frac{|S_v|}{|S|}
  • Indeks Gini (CART):
Gini(S)=1i=1cpi2\text{Gini}(S) = 1 - \sum_{i=1}^c p_i^2

2. Strategi Pemangkasan Pohon (Pruning)

Untuk menghindari masalah overfitting pada data latih, dilakukan pemangkasan cabang (pruning):

  • Pre-pruning: Menghentikan pembagian cabang jika kedalaman pohon mencapai max_depth atau jumlah sampel per daun kurang dari ambang batas minimum.
  • Post-pruning (Cost Complexity Pruning): Memangkas sub-pohon yang memiliki kontribusi minimal terhadap validasi silang.

3. Berkas Tugas Terlampir

  • Jupyter Notebook analisis: decision-tree-classification.ipynb yang mengimplementasikan visualisasi struktur diagram pohon, perhitungan gain, dan matriks konfusi performa.