Bỏ qua để đến nội dung
Search & RAG

1.4 RAG là gì, và vì sao nó phải tồn tại

RAG = Retrieval-Augmented Generation = “sinh câu trả lời có bổ trợ bằng tìm kiếm”.

LLM có ba giới hạn cứng:

  1. Không biết dữ liệu riêng của bạn. Nó chưa từng thấy tài liệu nội bộ của tổ chức bạn.
  2. Kiến thức đóng băng. Nó chỉ biết tới thời điểm được huấn luyện.
  3. Cửa sổ ngữ cảnh hữu hạn. Không thể nhồi 10.000 trang vào một câu hỏi — và ngay cả khi nhồi được thì cũng đắt và chất lượng giảm.

RAG giải cả ba bằng một ý tưởng đơn giản đến mức dễ bị coi nhẹ:

Tìm vài đoạn liên quan trước, dán chúng vào prompt, rồi mới hỏi LLM.

Điều quan trọng cần hiểu đúng ngay từ đầu:

⚠️ RAG không “dạy” model. Nó chỉ đưa tài liệu cho model đọc ngay lúc hỏi. Model không hề nhớ gì sau đó. Đây là chỗ khác biệt với fine-tune — fine-tune là thay đổi trọng số của model, đắt và chậm, và không phải cách để model biết dữ liệu mới của bạn.

Hệ quả trực tiếp và rất thực tế: nếu retrieval lấy sai đoạn thì LLM giỏi cỡ nào cũng trả lời sai. Nó chỉ được đọc đúng những gì bạn đưa cho nó.

Phần 1 — Nhập môn