Bỏ qua để đến nội dung
Search & RAG

Phụ lục — Lộ trình & baseline

  1. Không đo thì không tối ưu. Mọi thay đổi report trên cùng một golden set.
  2. Mỗi kỹ thuật phải trả giá. Ghi nhận đồng thời: chất lượng, latency, chi phí.
  3. Điểm mù đối xứng. Mỗi phương pháp đều có lớp truy vấn nó thua. Học là học nhận ra lớp đó, không phải học “cái nào tốt nhất”.
  4. Thứ tự ưu tiên đã được đo: dữ liệu & tokenization ≫ kiến trúc ≫ siêu tham số.
#ModuleCâu hỏi cốt lõiTrạng thái
0Metrics & golden setTệ ở khâu nào — retrieval hay generation?✅ đo xong
1Lexical retrievalBM25 thật sự làm gì? k1/b nghĩa là gì?✅ đo xong
2Dense retrieval & embeddingsVì sao model “biết” hai câu gần nghĩa?✅ đo xong
3Hybrid & fusionRRF vs weighted fusion. SPLADE.
4RerankingCross-encoder / ColBERT / LLM rerank — ROI thật?
5Chunking & indexingChunk size ảnh hưởng recall thế nào?
6ANN & hạ tầng vectorHNSW bên trong. Bẫy recall khi filter.
7Query understandingRewrite / decompose / HyDE — cái nào đáng tiền?
8Ma trận dữ liệu ↔ thuật toánLoại dữ liệu nào dùng gì?
9Context assembly & chống hallucinationGrounding, abstention, faithfulness.
10Agentic retrievalVì sao “agent” đổi thiết kế retrieval?
11ProductionLatency, cache, cost, freshness, observability.
12Áp vào sản phẩm AI AgentAudit → đo → xếp ưu tiên theo ROI.
Hệ thốngnDCG@5A (exact)B (paraphrase)C (multi-hop)D (phủ định)
BM25, tokenizer code-aware0.7870.9710.4560.8340.888
BM25 tinh chỉnh (k1=2.0)0.806
Dense tự train (128d)0.7530.9710.3540.8350.850
Dense + trừ tâm0.799

Latency BM25: 0.03 ms/query. Đây là mốc để so sánh chi phí mọi thứ thêm vào.

Phụ lục