tugas

Tugas 6: Analisis Komparatif Sparse Retrieval (BM25), Dense Retrieval, dan Hybrid Search

Tugas 6: Eksperimen Komparatif Sparse Retrieval (BM25), Dense Semantic Search, dan Hybrid Ranking

Kajian mutakhir Information Retrieval yang membandingkan performa pencarian leksikal berbasis kata kunci (sparse retrieval) melawan pencarian semantik vektor laten (dense retrieval) menggunakan model embedding berbasis transformer.

1. Tiga Paradigma Information Retrieval

  1. Sparse Lexical Retrieval (BM25): Sangat presisi dalam mencocokkan kata kunci spesifik, istilah teknis, nama orang, dan kode identifikasi, namun rentan mengalami vocabulary mismatch problem.
  2. Dense Semantic Retrieval (Vector Search): Memetakan teks ke dalam ruang representasi kontinu berdimensi padat (dense embeddings). Mampu menangkap sinonim dan makna konteks abstrak meskipun kata yang digunakan berbeda.
  3. Hybrid Search & Reciprocal Rank Fusion (RRF): Menggabungkan hasil peringkat dari sparse dan dense retrieval menggunakan formula:
RRF(d)=mM1k+rm(d)RRF(d) = \sum_{m \in M} \frac{1}{k + r_m(d)}

Di mana rm(d)r_m(d) adalah peringkat dokumen dd pada metode mm, dan kk adalah konstanta perata (k60k \approx 60).

2. Evaluasi pada Dataset Berita BBC

Pengujian empiris menggunakan dataset berita multi-kategori BBC News untuk mengevaluasi metrik Precision@K, Recall@K, dan Mean Reciprocal Rank (MRR).

3. Berkas Terlampir

  • Dokumen laporan komparasi: IR-Compare-240411100085.pdf.
  • Buku kerja eksperimen: IR-Compare-240411100085.ipynb.

Attachments