Bỏ qua để đến nội dung
Search & RAG

Phần 2 — Metrics

Không đo được thì không tối ưu được. Phần này giải thích vì sao mỗi metric tồn tại, nó giả định gì về người dùng, và nó mù với điều gì.

Tài liệu tham chiếu cho Module 0. Mục tiêu: hiểu vì sao mỗi metric tồn tại, nó giả định gì về người dùng, và nó mù với điều gì — chứ không phải học thuộc công thức.

Ký hiệu dùng xuyên suốt:

Ký hiệuNghĩa
qqmột truy vấn (topic)
DDcorpus
π=(d1,d2,)\pi = (d_1, d_2, \dots)danh sách ranking hệ trả về
rel(d){0,1,2,}\mathrm{rel}(d) \in \{0,1,2,\dots\}mức độ liên quan (graded relevance) của doc dd với qq
R={d:rel(d)>0}\mathcal{R} = \{d : \mathrm{rel}(d) > 0\}tập doc liên quan (ground truth)
R=RR = \lvert\mathcal{R}\rvertsố doc liên quan
kkđộ sâu cắt (cutoff)
#MụcNội dung
10. Nền tảng: metric đo cái gì, và dựa trên giả định nàoCranfield paradigm, graded vs binary, khung 3 trục
21. Nhóm SET-BASED — bỏ qua thứ tựSuccess@k, Recall@k, Precision@k và bẫy mẫu số, F-measure
32. Nhóm RANK-BASED, relevance NHỊ PHÂNMRR, MAP, đường precision–recall
43. Nhóm RANK-BASED, relevance CÓ MỨCDCG/nDCG, ERR, RBP, nhãn không hoàn chỉnh
54. Metrics cho pipeline RAG end-to-endFaithfulness, answer relevance, context precision/recall
65. Tổng hợp qua nhiều truy vấnMacro vs micro, phân tích theo lớp truy vấn
76. Ý nghĩa thống kê — phần dễ bị bỏ qua nhấtPhương sai giữa truy vấn, test nào phù hợp, effect size
87. Bảy lỗi phương pháp phổ biếnBảy lỗi làm mọi con số vô nghĩa
98. Bảng quyết định — chọn metric nàoBảng tra: mục tiêu nào → metric nào
109. Checklist cho bản metrics.py khi dựng lạiChecklist khi tự viết module metrics
1110. Nguồn tham khảoSách, paper nền tảng, benchmark, công cụ
12Phụ lục — bảng công thức một trangBảng công thức một trang