1.3 Ba nhân vật rất dễ lẫn
Người mới hay nghĩ “AI” là một thứ. Trong một hệ RAG có ba loại model khác nhau, làm ba việc khác nhau, giá khác nhau. Lẫn chúng là nguồn nhầm lẫn số một.
| Embedding model | Reranker | LLM | |
|---|---|---|---|
| Nhận vào | một đoạn văn | một cặp (câu hỏi, đoạn văn) | toàn bộ prompt |
| Trả ra | một danh sách số (vector) | một điểm số | văn bản |
| Việc | biến chữ thành toạ độ để so sánh | phán “đoạn này có trả lời câu này không” | viết câu trả lời |
| Chạy khi nào | trước (cả kho) + lúc truy vấn (câu hỏi) | lúc truy vấn, cho ~50–100 đoạn | lúc truy vấn, một lần |
| Giá | rẻ nhất | trung bình | đắt nhất |
| Ví dụ | text-embedding-*, voyage-* | rerank-*, cross-encoder | Claude, GPT |
Điểm mấu chốt: embedding model chạy trước cho toàn bộ corpus, một lần. Đó là lý do nó phải rẻ. Reranker chỉ chạy cho vài chục đoạn nên được phép đắt hơn. LLM chỉ chạy một lần cuối cùng nên được phép đắt nhất.