tugas
Tugas 6: Analisis Komparatif Sparse Retrieval (BM25), Dense Retrieval, dan Hybrid Search
Tugas 6: Eksperimen Komparatif Sparse Retrieval (BM25), Dense Semantic Search, dan Hybrid Ranking
Kajian mutakhir Information Retrieval yang membandingkan performa pencarian leksikal berbasis kata kunci (sparse retrieval) melawan pencarian semantik vektor laten (dense retrieval) menggunakan model embedding berbasis transformer.
1. Tiga Paradigma Information Retrieval
- Sparse Lexical Retrieval (BM25): Sangat presisi dalam mencocokkan kata kunci spesifik, istilah teknis, nama orang, dan kode identifikasi, namun rentan mengalami vocabulary mismatch problem.
- Dense Semantic Retrieval (Vector Search): Memetakan teks ke dalam ruang representasi kontinu berdimensi padat (dense embeddings). Mampu menangkap sinonim dan makna konteks abstrak meskipun kata yang digunakan berbeda.
- Hybrid Search & Reciprocal Rank Fusion (RRF): Menggabungkan hasil peringkat dari sparse dan dense retrieval menggunakan formula:
Di mana adalah peringkat dokumen pada metode , dan adalah konstanta perata ().
2. Evaluasi pada Dataset Berita BBC
Pengujian empiris menggunakan dataset berita multi-kategori BBC News untuk mengevaluasi metrik Precision@K, Recall@K, dan Mean Reciprocal Rank (MRR).
3. Berkas Terlampir
- Dokumen laporan komparasi:
IR-Compare-240411100085.pdf. - Buku kerja eksperimen:
IR-Compare-240411100085.ipynb.