Phần 1 — Nhập môn
Mười mục, đọc theo thứ tự. Mục 1.6, 1.7 và 1.9 có ví dụ tính bằng tay — tự tay tính lại thì phần còn lại của cẩm nang mới dễ.
Phần này viết cho người chưa từng làm search. Không giả định biết gì trước đó. Nếu bạn đã biết inverted index, vector và cosine là gì, nhảy thẳng sang Phần 2 — Metrics.
| # | Mục | Nội dung |
|---|---|---|
| 1 | 1.1 Vì sao không dùng Ctrl+F là xong? | Vocabulary mismatch — vấn đề gốc của mọi hệ tìm kiếm |
| 2 | 1.2 Từ vựng tối thiểu | corpus, document, query, term, relevance, ranking |
| 3 | 1.3 Ba nhân vật rất dễ lẫn | search vs retrieval vs RAG — ba thứ hay bị gọi lẫn |
| 4 | 1.4 RAG là gì, và vì sao nó phải tồn tại | Vì sao phải nhồi tài liệu vào prompt thay vì tin LLM |
| 5 | 1.5 Đi bộ qua một câu hỏi | Một truy vấn đi qua toàn bộ pipeline, từng bước |
| 6 | 1.6 Inverted index — dựng bằng tay | Dựng inverted index trên giấy — cấu trúc dữ liệu cốt lõi |
| 7 | 1.7 BM25 tính bằng tay | Tính điểm BM25 bằng tay: idf, tf saturation, độ dài |
| 8 | 1.8 Vector và embedding — trực giác hình học | Trực giác hình học: vector, cosine, không gian nghĩa |
| 9 | 1.9 “Tốt” nghĩa là gì | recall, precision, nDCG — đo trước khi tối ưu |
| 10 | 1.10 Bảy ngộ nhận của người mới | Bảy điều người mới hay tin sai |
Đọc xong Phần 1 thì đi đâu
Phần tiêu đề “Đọc xong Phần 1 thì đi đâu”Mặc định là đi tiếp theo thứ tự: Phần 2 — Metrics. Cẩm nang đặt metrics ngay sau nhập môn vì nguyên tắc đầu tiên của nó là không đo thì không tối ưu — mọi phần sau đều giả định bạn đã có thước đo trong tay.
| Bạn muốn | Đi tới |
|---|---|
| Đi tiếp theo lộ trình — dựng thước đo trước khi tối ưu bất cứ thứ gì | Phần 2 — Metrics |
| Hiểu cơ chế bên trong: postings, fuzzy search, prefix, top-k | Phần 3 — Nền tảng kỹ thuật |
| Đi thẳng vào lý thuyết hiện đại (embedding, hybrid, rerank) | Phần 4 — Lý thuyết |
| Xem baseline đã đo trên corpus của repo để có mốc so sánh | Phụ lục — Lộ trình & baseline |