Phần 8 — Áp vào sản phẩm AI Agent: thứ tự ưu tiên
Danh sách này giải quyết bốn điểm đau hay gặp nhất của một AI Agent chạy thật:
- Tìm không ra / tìm sai ngữ cảnh — retrieval trả về sai đoạn.
- Agent trả lời sai / bịa (hallucination).
- Chậm hoặc đắt — latency và cost không kiểm soát được.
- Không biết tốt hay tệ ở đâu — không có thước đo.
Xếp theo ROI đo được, không theo độ thú vị kỹ thuật.
| # | Việc | Vì sao trước | Chi phí |
|---|---|---|---|
| 1 | Dựng golden set + metric cho hệ thật | Bốn điểm đau ở trên không phân biệt được nếu không có số. Không có bước này thì mọi bước sau là đoán. | 1–2 ngày |
| 2 | Audit tokenizer / analyzer của index hiện tại | Đo được +20.8% ở lớp exact-match. Lỗi im lặng. | vài giờ |
| 3 | Đo tỷ lệ truy vấn không dấu (p) trên log | Một câu SQL. Nếu p > 17% thì phải fold dấu — thiết kế thay đổi. | 1 giờ |
| 4 | Đo recall@k của stage 1 | Nó là trần của mọi thứ phía sau. Quyết định tiền nên đổ vào retrieval hay reranker. | vài giờ |
| 5 | Thử centering embedding | +6.1% ở lab, chi phí ~0, không train lại. | vài giờ |
| 6 | Thêm reranker (nếu recall@k đã ổn) | ROI cao nhất trong các kỹ thuật thêm mới. | 1–2 ngày |
| 7 | Tách metric generation khỏi metric retrieval | Điểm đau “bịa” nằm ở đây, và Tầng 0–6 không chạm tới nó. | 1–2 ngày |
| 8 | Abstention + citation trong prompt | Cách rẻ nhất giảm hallucination. Không có đường từ chối thì model buộc phải bịa. | vài giờ |
| 9 | Phân loại dữ liệu theo ma trận Tầng 7 | Nếu đang nhồi bảng số vào vector index thì tối ưu embedding vô ích. | 1 ngày |
| 10 | Hybrid / chunking / ANN tuning / agentic | Chỉ sau khi 1–9 xong và có số. | — |
Ba câu hỏi nên trả lời trước khi viết một dòng code nào:
- Trong 100 câu trả lời sai gần nhất, bao nhiêu là lỗi retrieval và bao nhiêu là lỗi generation? (Nếu chưa biết → làm việc #1.)
- Tỷ lệ truy vấn thật của bạn phân bố thế nào giữa 4 lớp A/B/C/D? (Nó quyết định bạn nên đầu tư vào lexical, dense, agentic, hay abstention.)
- Dữ liệu của bạn có bao nhiêu phần thực ra là dữ liệu có cấu trúc bị đối xử như văn bản?