tugas
Tugas 1: Perancangan Web Crawler dan Arsitektur Search Engine Sederhana
Tugas 1: Perancangan Web Crawler dan Arsitektur Search Engine Sederhana
Pengembangan modul perayap web otomatis (web crawler) menggunakan framework Scrapy Python serta integrasi antarmuka pencarian dasar berbasis web untuk mengumpulkan dan mengindeks dokumen teks secara terstruktur dari repositori daring.
1. Arsitektur Komponen Web Crawler
- Scheduler & Downloader: Mengelola antrean URL target (frontier queue), melakukan permintaan HTTP request secara asinkron, dan menangani batasan robots.txt serta crawl delay guna mematuhi etika perayapan (politeness policy).
- Spider & Parser: Mengekstrak judul artikel, konten teks utama, tanggal publikasi, dan metadata dari berkas HTML menggunakan selektor CSS dan XPath yang tangguh.
- Item Pipeline: Melakukan pembersihan teks mentah (raw text cleansing), normalisasi karakter spasi, pemfilteran tag HTML liar, dan penyimpanan hasil perayapan ke dalam format terstruktur JSON/CSV.
2. Mekanisme Indexing dan Penelusuran Sederhana
Data hasil perayapan dimasukkan ke dalam basis data indeks lokal. Modul mesin pencari sederhana mencocokkan kueri pengguna menggunakan pencarian substring dan pencocokan kata kunci Boolean, kemudian menyajikan daftar tautan dokumen yang relevan beserta ringkasan cuplikan (snippet).
3. Berkas Tugas Terlampir
- Slide presentasi arsitektur sistem:
240411100085-tugas-SE.pptxyang menyajikan alur kerja pipeline perayapan hingga penyajian hasil. - Paket kode aplikasi lengkap:
tugas-search-engine-crawler.zipyang memuat skrip Scrapy crawler dan modul antarmuka pencarian web yang telah dibersihkan dari bloatware direktori paket.