Phụ lục — Sai số của tài liệu
Ba dự đoán tôi đã ghi ra và đo thấy sai — giữ lại để nhớ:
- “Bỏ stopword sẽ phá lớp D vì danh sách chứa từ phủ định.” → Lớp D không đổi. Cơ chế thật: IDF đã tự xử lý stopword. Cái bị phá là lớp B và C.
- “Dense retrieval sẽ thắng BM25 ở lớp paraphrase.” → Dense tự train kém hơn (0.354 vs 0.456). Sức mạnh của dense đến từ quy mô pre-training, không từ kiến trúc.
- “Matryoshka sẽ giữ chất lượng rõ rệt tốt hơn khi cắt chiều.” → Trên toy corpus lợi ích rất nhỏ (−19% vs −20%). Cơ chế đúng, độ lớn hiệu ứng cần dữ liệu thật.
Bài học phương pháp chung: toy corpus chứng minh được cơ chế, không chứng minh được độ lớn hiệu ứng. Mọi con số ở đây phải được đo lại trên dữ liệu thật của sản phẩm bạn đang làm trước khi dùng để ra quyết định.