tugas

Tugas 2: Text Preprocessing Manual, Tokenisasi, dan Pembobotan Kata TF-IDF

Tugas 2: Pemrosesan Teks Manual dan Kalkulasi Bobot Kata TF-IDF (Spreadsheet)

Perhitungan matematis manual tahap demi tahap untuk membedah mekanisme pembobotan term (term weighting) pada korpus dokumen teks guna memahami representasi Vektor Ruang Angka (Vector Space Model).

1. Tahapan Pemrosesan Teks (Text Preprocessing)

  1. Case Folding: Mengubah seluruh karakter huruf kapital menjadi huruf kecil (lowercase).
  2. Filtering & Punctuation Removal: Menghilangkan tanda baca, angka, simbol khusus, dan spasi ganda.
  3. Tokenizing: Memecah kalimat menjadi token kata independen.
  4. Stopword Removal: Menyaring kata umum yang tidak memiliki bobot pembeda (menggunakan daftar stopword bahasa Indonesia).
  5. Stemming: Mentransformasikan kata berimbuhan menjadi bentuk kata dasar.

2. Formulasi Matematis TF-IDF

  • Term Frequency (TFt,dTF_{t,d}): Frekuensi kemunculan term tt dalam dokumen dd.
  • Inverse Document Frequency (IDFtIDF_t): Mengukur kelangkaan term di seluruh koleksi dokumen NN:
IDFt=log10(NDFt)IDF_t = \log_{10}\left(\frac{N}{DF_t}\right)
  • Bobot Akhir (Wt,dW_{t,d}):
Wt,d=TFt,d×IDFtW_{t,d} = TF_{t,d} \times IDF_t

3. Berkas Lembar Kerja Terlampir

  • Tabulasi prapemrosesan teks: 240411100085-tugas-Preprocessing.xlsx.
  • Tabulasi kalkulasi matriks bobot TF-IDF: 240411100085-tugas-TF-IDF.xlsx.

Attachments