GPT của bạn có thể giao tiếp tự nhiên và tuân thủ hướng dẫn một cách hoàn hảo - nhưng nếu không nắm được dữ liệu cụ thể của bạn, nó vẫn chỉ đang phỏng đoán. Các file kiến thức sẽ biến một GPT thông thường thành một chuyên gia am hiểu về chính sách công ty, danh mục sản phẩm, tài liệu đào tạo hoặc bất kỳ thông tin chuyên ngành nào của bạn.
Trong bài học trước, bạn đã tìm hiểu về mô hình Vai trò-Quy tắc-Định dạng để viết hướng dẫn. Các file kiến thức hoạt động song song với những hướng dẫn đó - hướng dẫn quy định cách thức hoạt động, còn kiến thức cung cấp thông tin cần thiết.
Cách thức hoạt động của file kiến thức
Khi bạn upload một file lên GPT, OpenAI sẽ tự động xử lý file đó bằng công nghệ RAG (Retrieval Augmented Generation - Tạo nội dung có hỗ trợ truy xuất):
Chia nhỏ (Chunking) — file được chia thành các phần nhỏ hơn (gọi là "chunk").
Chuyển đổi sang dạng số (Embedding) — Mỗi phần nhỏ được chuyển đổi thành một dạng biểu diễn số (vector).
Lưu trữ (Storage) — Các vector này được lưu trữ để GPT sử dụng.
Truy xuất (Retrieval) — Khi người dùng đặt câu hỏi, hệ thống sẽ tìm kiếm các phần nhỏ có nội dung liên quan nhất.
Tạo nội dung (Generation) — GPT sử dụng các phần nhỏ đó làm ngữ cảnh để tạo ra câu trả lời.
Điều này có nghĩa là GPT không ghi nhớ toàn bộ file của bạn. Nó chỉ tìm kiếm các phần nội dung liên quan cho mỗi câu hỏi - tương tự như cách bạn lật tìm đúng chương trong sách giáo khoa.
Kiểm tra nhanh: Trong quy trình RAG, yếu tố nào kích hoạt việc truy xuất các phần nội dung cụ thể từ file kiến thức?
Trả lời: Câu hỏi của người dùng - hệ thống so khớp câu hỏi với các vector đã lưu trữ để tìm ra những phần nội dung liên quan nhất.
Giới hạn file và định dạng tối ưu
Giới hạn:
Tối đa 20 file cho mỗi GPT
Mỗi file tối đa 512 MB
Tối đa 2 triệu token mỗi file
10 GB mỗi người dùng, 100 GB mỗi tổ chức
Các định dạng tối ưu (xếp theo độ tin cậy):
Định dạng
Chất lượng
Ghi chú
Markdown (.md)
Xuất sắc
Các tiêu đề rõ ràng giúp chia nhỏ nội dung
Plain text (.txt)
Xuất sắc
Đơn giản và đáng tin cậy
PDF (single column)
Tốt
Hoạt động hiệu quả với các báo cáo và tài liệu
Word (.docx)
Tốt
Bảng và định dạng được giữ nguyên
CSV/Excel
Tốt
Rất phù hợp cho dữ liệu có cấu trúc
PDF (multi-column)
Tệ
Công cụ phân tích gặp khó khăn với bố cục
PowerPoint
Tệ
Văn bản định vị không được hiểu
Các file chứa nhiều hình ảnh
Tệ
Chỉ văn bản mới được xử lý
Điểm mấu chốt: Bộ phân tích dữ liệu (parser) hoạt động hiệu quả nhất với định dạng đơn giản. Một file Markdown gọn gàng sẽ mang lại kết quả tốt hơn so với file PDF được thiết kế cầu kỳ, vì thuật toán chia nhỏ dữ liệu có thể tách nội dung dựa trên các ranh giới tiêu đề rõ ràng.
Chuẩn bị file để upload
Trước khi upload, hãy tối ưu hóa file để hệ thống truy xuất thông tin hiệu quả hơn:
1. Thêm các tiêu đề mục rõ ràng
Thay vì trình bày một khối văn bản dày đặc, hãy tổ chức nội dung bằng các tiêu đề.
Mở ChatGPT (chat.openai.com), Claude (claude.ai) hoặc Gemini (gemini.google.com) và bắt đầu một cuộc trò chuyện mới, rồi sao chép câu lệnh (prompt) này:
# Chính sách đổi trả sản phẩm
## Điều kiện áp dụng
Sản phẩm có thể được đổi trả trong vòng 30 ngày kể từ ngày mua...
## Quy trình
Để bắt đầu quy trình đổi trả, vui lòng gửi email đến returns@example.com...
## Các trường hợp ngoại lệ
Các sản phẩm điện tử phải được đổi trả trong vòng 14 ngày...
2. Đưa thông tin quan trọng lên đầu
Hãy đặt những thông tin cốt lõi ở phần đầu của mỗi mục. Các đoạn dữ liệu (chunk) trong hệ thống RAG có giới hạn về kích thước, do đó thông tin nằm ở phần đầu của một mục sẽ có khả năng được truy xuất chính xác hơn.
3. Cung cấp đầy đủ ngữ cảnh trong mỗi mục
Đừng mặc định rằng GPT sẽ đọc các mục theo đúng thứ tự. Mỗi mục cần phải có nội dung độc lập, tự giải nghĩa được:
Cách viết chưa tốt: "Như đã đề cập ở trên, chính sách này áp dụng cho..."
Cách viết tốt: "Chính sách đổi trả trong vòng 30 ngày áp dụng cho..."
Kiểm tra nhanh: Tại sao mỗi mục trong file kiến thức cần phải độc lập và không nên tham chiếu đến các mục khác?
Trả lời: RAG truy xuất các đoạn dữ liệu riêng lẻ chứ không phải toàn bộ file. Một đoạn dữ liệu có nội dung "như đã đề cập ở trên" sẽ bị mất ngữ cảnh vì phần "ở trên" không nằm trong phạm vi truy xuất.
Hướng dẫn GPT sử dụng file kiến thức
Chỉ upload file lên là chưa đủ - bạn cần hướng dẫn GPT cách sử dụng chúng. Việc này giúp ngăn chặn GPT bỏ qua các file của bạn và tự bịa ra câu trả lời dựa trên dữ liệu huấn luyện chung.
Hãy thêm các chỉ dẫn như:
CÁCH SỬ DỤNG FILE KIẾN THỨC:
- Trước khi trả lời bất kỳ câu hỏi nào, hãy tìm kiếm thông tin liên quan
trong file đã upload có tên "company-policies.md"
- Nếu tìm thấy câu trả lời trong file kiến thức, hãy trích dẫn
phần thông tin cụ thể đó
- Nếu KHÔNG tìm thấy câu trả lời trong file kiến thức, hãy nói:
"Tôi không có thông tin cụ thể đó trong tài liệu tham khảo
của mình. Dưới đây là những gì tôi biết dựa trên kiến thức chung: [câu trả lời]"
- Khi người dùng hỏi về các chính sách, LUÔN kiểm tra file kiến
thức trước tiên — không dựa vào dữ liệu huấn luyện chung
Cách điền thông tin chi tiết: Thay thế các phần trong dấu ngoặc vuông [] bằng thông tin cụ thể từ tình huống thực tế của bạn. Đầu vào mơ hồ sẽ tạo ra kết quả mơ hồ - hãy đưa ra thông tin cụ thể, rõ ràng.
Kết quả hiển thị: Chỉ trong vài giây, AI sẽ đưa ra phản hồi được trình bày có cấu trúc dựa trên câu lệnh ở trên. Hãy đọc kỹ và coi đó là bản nháp, không phải là câu trả lời cuối cùng.
Cách xử lý kết quả: Lưu lại phản hồi vào file ghi chú. Hãy chọn ra một gợi ý mang lại hiệu quả cao nhất và thực hiện ngay trong tuần này - đừng cố làm tất cả mọi thứ cùng lúc.
Nếu kết quả chưa phù hợp: Nếu các gợi ý có vẻ chung chung, hãy gửi thêm yêu cầu: "Hãy đưa ra gợi ý cụ thể hơn dựa trên bối cảnh thực tế của tôi. Bỏ qua những lời khuyên chung chung". Nếu hệ thống bỏ sót các chi tiết quan trọng mà bạn đã cung cấp, hãy thêm nội dung "Bạn đã bỏ sót [X] trong bối cảnh của tôi - hãy thực hiện lại và coi đó là yêu cầu bắt buộc hàng đầu".
Những gì nên (và không nên) upload
Các file kiến thức phù hợp:
Sổ tay và chính sách công ty
Danh mục sản phẩm và thông số kỹ thuật
Tài liệu FAQ (Câu hỏi thường gặp)
Tài liệu hướng dẫn đào tạo
Hướng dẫn về phong cách và giọng văn thương hiệu
Tài liệu kỹ thuật
Quy trình vận hành tiêu chuẩn (SOP)
Các file kiến thức không phù hợp:
Dữ liệu thay đổi thường xuyên (hãy dùng Actions/API thay thế)
Toàn bộ cơ sở dữ liệu (quá lớn, việc truy xuất sẽ kém tin cậy)
Dữ liệu bảo mật mà bạn không muốn OpenAI xử lý
Nội dung chứa nhiều hình ảnh (hình ảnh không được xử lý)
Khắc phục sự cố truy xuất kiến thức
Vấn đề
Nguyên nhân có thể
Giải pháp
GPT bỏ qua file
Không có hướng dẫn cụ thể nào về việc sử dụng nó
Thêm "tìm kiếm trong file kiến thức trước" vào phần hướng dẫn
Các câu trả lời sai
Các đoạn trích thiếu ngữ cảnh
Bổ sung ngữ cảnh cho tiêu đề của từng phần
Các câu trả lời chưa đầy đủ
Thông tin được chia nhỏ thành các phần
Gộp các thông tin liên quan lại dưới một tiêu đề
"Tôi không có thông tin đó"
Nội dung không khớp với các từ khóa tìm kiếm
Hãy sử dụng cùng loại từ ngữ mà người dùng sẽ sử dụng
Bài tập thực hành
Chọn một tài liệu mà bạn am hiểu (ví dụ: quy định công ty, hướng dẫn sản phẩm hoặc tài liệu tham khảo cá nhân)
Chuyển đổi tài liệu sang định dạng Markdown với các tiêu đề rõ ràng (hoặc sử dụng file PDF có bố cục gọn gàng)
Upload file lên GPT của bạn tại tab Định cấu hình) → mục Kiến thức
Bổ sung hướng dẫn sử dụng file kiến thức vào phần chỉ dẫn của GPT
Kiểm tra bằng 5 câu hỏi — xác nhận rằng GPT lấy câu trả lời từ file thay vì sử dụng kiến thức tổng quát
Những điểm chính cần lưu ý
Các file kiến thức hoạt động dựa trên cơ chế RAG: Chia nhỏ dữ liệu (chunking), chuyển đổi thành vector (embedding), truy xuất (retrieval) và tạo phản hồi (generation)
Định dạng Markdown và plain text với tiêu đề rõ ràng mang lại hiệu quả tốt nhất cho quá trình truy xuất
Yêu cầu GPT kiểm tra các file kiến thức trước khi đưa ra câu trả lời
Mỗi phần nội dung nên mang tính độc lập vì cơ chế RAG sẽ truy xuất từng đoạn dữ liệu riêng lẻ
Không upload các dữ liệu thường xuyên thay đổi - hãy sử dụng tính năng API Actions để lấy dữ liệu cập nhật theo thời gian thực
Câu 1:
GPT của bạn không tham chiếu đến file kiến thức mà bạn đã upload. Bạn nên thử cách nào đầu tiên?
GIẢI THÍCH:
Việc thêm các hướng dẫn cụ thể như "Trước khi trả lời bất kỳ câu hỏi nào, hãy tìm kiếm thông tin liên quan trong file đã upload [tên file]" sẽ yêu cầu GPT sử dụng các file kiến thức của bạn một cách rõ ràng. Nếu thiếu hướng dẫn này, GPT có thể dựa vào dữ liệu huấn luyện tổng quát thay vì các tài liệu bạn đã upload.
Câu 2:
Định dạng nào hoạt động TỐT NHẤT cho các file kiến thức của GPT?
GIẢI THÍCH:
Công cụ xử lý (parser) của OpenAI hoạt động hiệu quả nhất với văn bản đơn giản, dạng một cột. Markdown và plain text có tiêu đề rõ ràng là lựa chọn lý tưởng vì quá trình chia nhỏ nội dung có thể thực hiện dựa trên ranh giới các phần. Các file PDF nhiều cột gây khó khăn cho công cụ xử lý, và hình ảnh thì không được xử lý.
Câu 3:
Điều gì xảy ra khi bạn upload file kiến thức lên một GPT tùy chỉnh?
GIẢI THÍCH:
OpenAI sử dụng cơ chế Retrieval Augmented Generation (RAG - Tạo nội dung có hỗ trợ truy xuất). File được chia nhỏ và chuyển đổi thành vector (nhúng). Khi người dùng đặt câu hỏi, hệ thống tìm kiếm các đoạn nội dung phù hợp nhất và đưa chúng vào ngữ cảnh để tạo phản hồi. GPT không ghi nhớ toàn bộ nội dung file.
Theo Nghị định 147/2024/ND-CP, bạn cần xác thực tài khoản trước khi sử dụng tính năng này. Chúng tôi sẽ gửi mã xác thực qua SMS hoặc Zalo tới số điện thoại mà bạn nhập dưới đây: