Bỏ qua để đến nội dung
Search & RAG

Phần 8 — Áp vào sản phẩm AI Agent: thứ tự ưu tiên

Danh sách này giải quyết bốn điểm đau hay gặp nhất của một AI Agent chạy thật:

  1. Tìm không ra / tìm sai ngữ cảnh — retrieval trả về sai đoạn.
  2. Agent trả lời sai / bịa (hallucination).
  3. Chậm hoặc đắt — latency và cost không kiểm soát được.
  4. Không biết tốt hay tệ ở đâu — không có thước đo.

Xếp theo ROI đo được, không theo độ thú vị kỹ thuật.

#ViệcVì sao trướcChi phí
1Dựng golden set + metric cho hệ thậtBốn điểm đau ở trên không phân biệt được nếu không có số. Không có bước này thì mọi bước sau là đoán.1–2 ngày
2Audit tokenizer / analyzer của index hiện tạiĐo được +20.8% ở lớp exact-match. Lỗi im lặng.vài giờ
3Đo tỷ lệ truy vấn không dấu (p) trên logMột câu SQL. Nếu p > 17% thì phải fold dấu — thiết kế thay đổi.1 giờ
4Đo recall@k của stage 1Nó là trần của mọi thứ phía sau. Quyết định tiền nên đổ vào retrieval hay reranker.vài giờ
5Thử centering embedding+6.1% ở lab, chi phí ~0, không train lại.vài giờ
6Thêm reranker (nếu recall@k đã ổn)ROI cao nhất trong các kỹ thuật thêm mới.1–2 ngày
7Tách metric generation khỏi metric retrievalĐiểm đau “bịa” nằm ở đây, và Tầng 0–6 không chạm tới nó.1–2 ngày
8Abstention + citation trong promptCách rẻ nhất giảm hallucination. Không có đường từ chối thì model buộc phải bịa.vài giờ
9Phân loại dữ liệu theo ma trận Tầng 7Nếu đang nhồi bảng số vào vector index thì tối ưu embedding vô ích.1 ngày
10Hybrid / chunking / ANN tuning / agenticChỉ sau khi 1–9 xong và có số.

Ba câu hỏi nên trả lời trước khi viết một dòng code nào:

  1. Trong 100 câu trả lời sai gần nhất, bao nhiêu là lỗi retrieval và bao nhiêu là lỗi generation? (Nếu chưa biết → làm việc #1.)
  2. Tỷ lệ truy vấn thật của bạn phân bố thế nào giữa 4 lớp A/B/C/D? (Nó quyết định bạn nên đầu tư vào lexical, dense, agentic, hay abstention.)
  3. Dữ liệu của bạn có bao nhiêu phần thực ra là dữ liệu có cấu trúc bị đối xử như văn bản?