Bỏ qua để đến nội dung
Search & RAG

5. Tổng hợp qua nhiều truy vấn

Cách tínhHệ quả
MacroTính metric cho từng truy vấn, rồi lấy trung bìnhMỗi truy vấn có cùng trọng số
MicroGộp tất cả hit/miss của mọi truy vấn rồi tính một lầnTruy vấn có nhiều doc liên quan chi phối

Trong IR, luôn dùng macro. Đó là mặc định của trec_eval và của mọi paper. Lý do: đơn vị quan tâm là “một người dùng gõ một câu hỏi”, không phải “một cặp (query, doc)”.

Bản metrics.py từng có trong repo dùng macro — đúng. (Code đã được gỡ; xem §9.)

Điểm trung bình toàn cục che mất thông tin hữu ích: một hệ có thể tăng điểm tổng nhờ giỏi hơn ở lớp A mà đồng thời tệ đi ở lớp D. Chỉ bảng chia theo lớp mới cho biết bạn vừa đánh đổi cái gì.

Nhưng chú ý cỡ mẫu: với 24 truy vấn chia 4 lớp = 6 truy vấn/lớp. Ở mức đó, bảng per-class chỉ dùng để chẩn đoán định tính (“class D sụp hẳn, đi xem tại sao”), tuyệt đối không dùng để ra quyết định A/B. Xem §6.

Phần 2 — Metrics