tugas
Tugas 7: Perancangan Arsitektur Retrieval-Augmented Generation (RAG) Terpadu
Tugas 7: Arsitektur Retrieval-Augmented Generation (RAG) Menggunakan Vektor Embedding
Pembangunan pipeline modern Retrieval-Augmented Generation (RAG) yang memadukan keunggulan mesin pencari informasi berbasis vektor embedding dengan kemampuan pemahaman model bahasa besar (Large Language Model / LLM) untuk menghasilkan jawaban faktual dan bebas halusinasi.
1. Alur Kerja Komponen Pipeline RAG
- Document Ingestion & Chunking: Dokumen teks dipotong menjadi segmen kecil (chunks) dengan ukuran tetap (misalnya 500 token) dengan sliding window overlap (50 token) untuk menjaga keutuhan konteks narasi.
- Dense Semantic Embedding: Setiap chunk diubah menjadi representasi vektor dense berdimensi tinggi menggunakan model embedding transformer (seperti
sentence-transformers/all-MiniLM-L6-v2atau OpenAItext-embedding-3-small). - Pencarian Kesamaan Vektor (Vector Search): Kueri pengguna dienkode menjadi vektor dan dicocokkan ke indeks basis data vektor (ChromaDB / FAISS) menggunakan pencarian tetangga terdekat (Approximate Nearest Neighbors / ANN).
- Context Injection & Prompt Engineering: Potongan teks yang paling relevan disisipkan ke dalam template prompt sistem sebagai konteks grounding:
- Generasi Jawaban Faktual: LLM memproses prompt berkonteks untuk menyajikan jawaban akurat dengan referensi kutipan sumber dokumen yang terverifikasi.
2. Berkas Tugas Terlampir
- Laporan kajian arsitektur RAG:
IR-RAG-240411100085.pdfyang membahas mitigasi halusinasi, metrik RAGAS (faithfulness dan answer relevancy), dan trade-off panjang konteks. - Jupyter Notebook implementasi teruji:
IR_RAG_240411100085.ipynbyang memuat pipeline chunking, kalkulasi embedding, dan antarmuka query LLM interaktif.