4. Metrics cho pipeline RAG end-to-end
§1–3 đo retrieval. RAG có thêm tầng generation, và các metric dưới đây đo những thứ retrieval metrics không thể thấy.
4.1 Bốn metric cốt lõi
Phần tiêu đề “4.1 Bốn metric cốt lõi”| Metric | Câu hỏi | Cách đo |
|---|---|---|
| Context Recall | Context có chứa mọi mệnh đề cần để trả lời? | Tách ground-truth answer thành các claim; đếm claim nào có support trong context |
| Context Precision | Các chunk liên quan có nằm trên đầu context? | Giống AP nhưng tính trên chunk đưa vào prompt |
| Faithfulness / Groundedness | Mỗi câu trong answer có truy được về context? | Tách answer thành claim; LLM-judge từng claim vs context |
| Answer Relevance | Answer có trả lời đúng câu được hỏi? | Sinh ngược câu hỏi từ answer, đo similarity với query gốc |
Thêm một metric rẻ và rất hữu ích cho production: Citation Accuracy — tỷ lệ citation trong answer trỏ đúng doc thực sự chứa thông tin đó. Đo được bằng string matching / substring overlap, không cần LLM, nên chạy được online.
4.2 Hai điều phải hiểu về nhóm này
Phần tiêu đề “4.2 Hai điều phải hiểu về nhóm này”(1) Chúng độc lập với nhau và độc lập với nDCG. Bốn tổ hợp đều xảy ra thật:
| nDCG@5 | Faithfulness | Chẩn đoán |
|---|---|---|
| cao | cao | Hệ tốt |
| cao | thấp | Retrieval ổn, LLM bịa dù có đủ tài liệu → sửa prompt/model, không sửa retrieval |
| thấp | cao | LLM đủ giỏi để lọc rác, nhưng đang trả lời từ tri thức nội tại → nguy hiểm, sẽ sai khi hỏi về nội dung mới |
| thấp | thấp | Sửa retrieval trước |
Nếu chỉ đo retrieval, bạn mù với một nửa hệ thống. Nếu chỉ đo end-to-end, bạn không biết sửa ở đâu khi điểm tụt.
(2) Chúng dựa trên LLM-judge → có noise và có bias. Bắt buộc calibrate trước khi tin:
- Lấy ~30–50 mẫu, tự gán nhãn tay.
- Đo agreement giữa judge và bạn (Cohen’s ).
- → judge chưa đáng tin, sửa rubric rồi lặp lại.
- Ghi lại model + prompt + version của judge. Đổi judge = đổi thước đo → mọi số trước đó không so được nữa.
Các bias đã biết của LLM-judge: thiên vị câu trả lời dài, thiên vị vị trí (trong so sánh cặp), thiên vị output của chính họ hàng model mình, và có xu hướng cho điểm cao quá.