tugas
Tugas 2: Text Preprocessing Manual, Tokenisasi, dan Pembobotan Kata TF-IDF
Tugas 2: Pemrosesan Teks Manual dan Kalkulasi Bobot Kata TF-IDF (Spreadsheet)
Perhitungan matematis manual tahap demi tahap untuk membedah mekanisme pembobotan term (term weighting) pada korpus dokumen teks guna memahami representasi Vektor Ruang Angka (Vector Space Model).
1. Tahapan Pemrosesan Teks (Text Preprocessing)
- Case Folding: Mengubah seluruh karakter huruf kapital menjadi huruf kecil (lowercase).
- Filtering & Punctuation Removal: Menghilangkan tanda baca, angka, simbol khusus, dan spasi ganda.
- Tokenizing: Memecah kalimat menjadi token kata independen.
- Stopword Removal: Menyaring kata umum yang tidak memiliki bobot pembeda (menggunakan daftar stopword bahasa Indonesia).
- Stemming: Mentransformasikan kata berimbuhan menjadi bentuk kata dasar.
2. Formulasi Matematis TF-IDF
- Term Frequency (): Frekuensi kemunculan term dalam dokumen .
- Inverse Document Frequency (): Mengukur kelangkaan term di seluruh koleksi dokumen :
- Bobot Akhir ():
3. Berkas Lembar Kerja Terlampir
- Tabulasi prapemrosesan teks:
240411100085-tugas-Preprocessing.xlsx. - Tabulasi kalkulasi matriks bobot TF-IDF:
240411100085-tugas-TF-IDF.xlsx.