5. Tổng hợp qua nhiều truy vấn
5.1 Macro vs micro average
Phần tiêu đề “5.1 Macro vs micro average”| Cách tính | Hệ quả | |
|---|---|---|
| Macro | Tính metric cho từng truy vấn, rồi lấy trung bình | Mỗi truy vấn có cùng trọng số ✅ |
| Micro | Gộp tất cả hit/miss của mọi truy vấn rồi tính một lần | Truy vấn có nhiều doc liên quan chi phối ❌ |
Trong IR, luôn dùng macro. Đó là mặc định của trec_eval và của mọi paper. Lý
do: đơn vị quan tâm là “một người dùng gõ một câu hỏi”, không phải “một cặp
(query, doc)”.
Bản metrics.py từng có trong repo dùng macro — đúng. (Code đã được gỡ; xem §9.)
5.2 Phân tích theo lớp truy vấn
Phần tiêu đề “5.2 Phân tích theo lớp truy vấn”Điểm trung bình toàn cục che mất thông tin hữu ích: một hệ có thể tăng điểm tổng nhờ giỏi hơn ở lớp A mà đồng thời tệ đi ở lớp D. Chỉ bảng chia theo lớp mới cho biết bạn vừa đánh đổi cái gì.
Nhưng chú ý cỡ mẫu: với 24 truy vấn chia 4 lớp = 6 truy vấn/lớp. Ở mức đó, bảng per-class chỉ dùng để chẩn đoán định tính (“class D sụp hẳn, đi xem tại sao”), tuyệt đối không dùng để ra quyết định A/B. Xem §6.