0. Nền tảng: metric đo cái gì, và dựa trên giả định nào
0.1 Cranfield paradigm
Phần tiêu đề “0.1 Cranfield paradigm”Toàn bộ nhóm metric ở tài liệu này thừa hưởng từ các thí nghiệm Cranfield (Cleverdon, thập niên 1960). Mô hình đó nói: để so sánh hai hệ retrieval, ta cần một test collection gồm ba thành phần:
- Corpus — tập tài liệu cố định
- Topics — tập truy vấn cố định
- Qrels (query relevance judgments) — nhãn liên quan do người gán
rồi chạy cả hai hệ trên cùng ba thứ đó và so điểm. data/corpus.jsonl +
data/goldenset.jsonl của chúng ta chính là một test collection cỡ nhỏ.
Cranfield đi kèm bốn giả định — và mọi hạn chế của metric đều truy về được một trong bốn cái này:
| Giả định | Thực tế | Hệ quả khi vỡ |
|---|---|---|
| Độc lập topic: điểm của truy vấn A không liên quan gì tới truy vấn B | Thường đúng | — |
| Độc lập tài liệu: giá trị của doc không phụ thuộc các doc khác trong kết quả | Sai — 3 doc trùng nội dung không giá trị gấp 3 | nDCG/AP thổi phồng hệ trả về kết quả dư thừa → cần ERR, hoặc metric diversity |
| Nhãn hoàn chỉnh: mọi doc trong corpus đều đã được gán nhãn | Sai với corpus lớn | Pooling bias: hệ mới bị phạt oan vì tìm ra doc tốt chưa gán nhãn → cần bpref/infAP/RBP-residual |
| Nhãn khách quan: relevance là thuộc tính của cặp (query, doc) | Sai — người gán nhãn bất đồng ~30–50% | Điểm tuyệt đối không đáng tin; thứ hạng giữa các hệ vẫn khá bền (Voorhees 2000) |
Điểm cuối rất quan trọng và hay bị hiểu sai: bất đồng giữa người gán nhãn không phá huỷ giá trị của test collection. Nó làm điểm tuyệt đối kém tin cậy, nhưng thứ tự “hệ A tốt hơn hệ B” thì tương đối bền vững. Nghĩa là: đừng bao giờ diễn giải nDCG@5 = 0.72 như một sự thật tuyệt đối; hãy dùng nó để so sánh.
0.2 Graded vs binary relevance
Phần tiêu đề “0.2 Graded vs binary relevance”Quy ước của golden set này:
2 = tài liệu trực tiếp trả lời truy vấn1 = liên quan, hỗ trợ ngữ cảnh0 = không liên quan (không ghi trong golden set)Thang 3 mức là lựa chọn tốt cho RAG, và lý do là kinh tế học của việc gán nhãn: thang càng nhiều mức thì người gán nhãn càng bất đồng, và mức 3 là ngưỡng mà con người còn phân biệt được đáng tin cậy. TREC Web Track dùng 4–6 mức và phải trả giá bằng agreement thấp hơn.
Có hai hệ quả kỹ thuật:
- Metric binary (recall, precision, MRR, MAP) phải nhị phân hoá — thường là
rel > 0. Việc này xoá thông tin: doc “trả lời trực tiếp” và doc “nhắc đến vấn đề” trở nên tương đương. - Metric graded (DCG/nDCG, ERR, RBP) dùng được trực tiếp thang 0/1/2.
Đây là lý do nDCG là thước chính cho RAG: chỉ nó biết phân biệt hai loại doc trên.
0.3 Khung tư duy 3 trục
Phần tiêu đề “0.3 Khung tư duy 3 trục”Mọi metric là một điểm trong không gian ba trục:
| Trục | Hai đầu | Ý nghĩa |
|---|---|---|
| Thứ tự | Set-based ↔ Rank-based | Set-based: hoán vị top-k không đổi điểm |
| Relevance | Binary ↔ Graded | Binary mù với mức độ |
| Chuẩn hoá | Raw ↔ Normalized | Raw bị thống trị bởi truy vấn “giàu” doc liên quan |
nDCG là điểm duy nhất trong nhóm cổ điển ở góc rank-based + graded + normalized — đó là toàn bộ lý do nó thống trị.