Bỏ qua để đến nội dung
Search & RAG

1.3 Ba nhân vật rất dễ lẫn

Người mới hay nghĩ “AI” là một thứ. Trong một hệ RAG có ba loại model khác nhau, làm ba việc khác nhau, giá khác nhau. Lẫn chúng là nguồn nhầm lẫn số một.

Embedding modelRerankerLLM
Nhận vàomột đoạn vănmột cặp (câu hỏi, đoạn văn)toàn bộ prompt
Trả ramột danh sách số (vector)một điểm sốvăn bản
Việcbiến chữ thành toạ độ để so sánhphán “đoạn này có trả lời câu này không”viết câu trả lời
Chạy khi nàotrước (cả kho) + lúc truy vấn (câu hỏi)lúc truy vấn, cho ~50–100 đoạnlúc truy vấn, một lần
Giárẻ nhấttrung bìnhđắt nhất
Ví dụtext-embedding-*, voyage-*rerank-*, cross-encoderClaude, GPT

Điểm mấu chốt: embedding model chạy trước cho toàn bộ corpus, một lần. Đó là lý do nó phải rẻ. Reranker chỉ chạy cho vài chục đoạn nên được phép đắt hơn. LLM chỉ chạy một lần cuối cùng nên được phép đắt nhất.

Phần 1 — Nhập môn