Sistem tidak hanya mengandalkan kemiripan vektor teks biasa (*Cosine Similarity*), melainkan menerapkan pembobotan pintar:
- Tag Match Boost (+0.30): Jika sebuah dokumen memiliki Tag yang sesuai dengan kata kunci pencarian, nilai relevansinya otomatis dinaikkan secara drastis agar tidak tenggelam.
- Exact Keyword Match (+0.15): Tambahan skor untuk paragraf yang memuat kata kunci persis.
Mencegah 1 atau 2 dokumen memonopoli seluruh hasil pencarian:
- Representasi Adil: Sistem mengambil 1–2 paragraf terbaik dari setiap dokumen yang cocok terlebih dahulu sebelum kuota dipenuhi.
- Kapasitas Ditingkatkan: Kuota chunk dinaikkan menjadi 10 paragraf (dari sebelumnya 5), memastikan seluruh dokumen dengan tag sama tercantum lengkap di referensi.
Prinsip kerja ekstraksi dokumen tanpa rekayasa/asumsi:
- Chunking & Embedding: Setiap PDF dipecah per paragraf dan dikonversi ke vektor embedding 768 dimensi (*gemini-embedding-001*).
- Strict Fact Extraction: AI diwajibkan hanya mencatat data resmi yang tertulis persis di dokumen (nomor regulasi, perihal, status, butir ketetapan) tanpa opini percakapan.
Otomatisasi taksonomi dan kesegaran data real-time:
- Auto-Tagging saat Upload: AI secara otomatis mengekstrak 5–8 kata kunci strategis per dokumen PDF.
- Real-Time Cache Invalidation: Jika di kemudian hari ada dokumen baru yang diunggah dengan Tag yang relevan, cache pencarian lama otomatis ditolak dan AI melakukan RAG ulang agar jawaban selalu up-to-date.
- Role Filtering: Dokumen disaring ketat di level server sesuai izin hak akses (Umum / Internal / Pimpinan).