Bỏ qua để đến nội dung
Search & RAG

4. Metrics cho pipeline RAG end-to-end

§1–3 đo retrieval. RAG có thêm tầng generation, và các metric dưới đây đo những thứ retrieval metrics không thể thấy.

MetricCâu hỏiCách đo
Context RecallContext có chứa mọi mệnh đề cần để trả lời?Tách ground-truth answer thành các claim; đếm claim nào có support trong context
Context PrecisionCác chunk liên quan có nằm trên đầu context?Giống AP nhưng tính trên chunk đưa vào prompt
Faithfulness / GroundednessMỗi câu trong answer có truy được về context?Tách answer thành claim; LLM-judge từng claim vs context
Answer RelevanceAnswer có trả lời đúng câu được hỏi?Sinh ngược câu hỏi từ answer, đo similarity với query gốc

Thêm một metric rẻ và rất hữu ích cho production: Citation Accuracy — tỷ lệ citation trong answer trỏ đúng doc thực sự chứa thông tin đó. Đo được bằng string matching / substring overlap, không cần LLM, nên chạy được online.

(1) Chúng độc lập với nhau và độc lập với nDCG. Bốn tổ hợp đều xảy ra thật:

nDCG@5FaithfulnessChẩn đoán
caocaoHệ tốt
caothấpRetrieval ổn, LLM bịa dù có đủ tài liệu → sửa prompt/model, không sửa retrieval
thấpcaoLLM đủ giỏi để lọc rác, nhưng đang trả lời từ tri thức nội tại → nguy hiểm, sẽ sai khi hỏi về nội dung mới
thấpthấpSửa retrieval trước

Nếu chỉ đo retrieval, bạn mù với một nửa hệ thống. Nếu chỉ đo end-to-end, bạn không biết sửa ở đâu khi điểm tụt.

(2) Chúng dựa trên LLM-judge → có noise và có bias. Bắt buộc calibrate trước khi tin:

  1. Lấy ~30–50 mẫu, tự gán nhãn tay.
  2. Đo agreement giữa judge và bạn (Cohen’s κ\kappa).
  3. κ<0.6\kappa < 0.6 → judge chưa đáng tin, sửa rubric rồi lặp lại.
  4. Ghi lại model + prompt + version của judge. Đổi judge = đổi thước đo → mọi số trước đó không so được nữa.

Các bias đã biết của LLM-judge: thiên vị câu trả lời dài, thiên vị vị trí (trong so sánh cặp), thiên vị output của chính họ hàng model mình, và có xu hướng cho điểm cao quá.

Phần 2 — Metrics