Tải tệp PDF cho RAG
Để bắt đầu triển khai Retrieval Augmented Generation (RAG), trước tiên bạn cần tải các tài liệu mà mô hình sẽ truy cập. Những tài liệu này có thể đến từ nhiều nguồn khác nhau, và LangChain hỗ trợ bộ nạp (loader) cho nhiều loại nguồn.
Trong bài tập này, bạn sẽ dùng một bộ nạp tài liệu để tải tệp PDF chứa bài báo Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks của Lewis và cộng sự (2021). Tệp này có sẵn với tên 'rag_paper.pdf'.
Lưu ý: pypdf, một phụ thuộc dùng để tải tài liệu PDF trong LangChain, đã được cài đặt sẵn cho bạn.
Bài tập này là một phần của khóa học
Retrieval Augmented Generation (RAG) với LangChain
Hướng dẫn bài tập
- Import lớp phù hợp để tải tài liệu PDF trong LangChain.
- Tạo một bộ nạp tài liệu cho tệp
'rag_paper.pdf'. - Tải tài liệu vào bộ nhớ để xem nội dung của tài liệu, hoặc trang, đầu tiên.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import library
from langchain_community.document_loaders import ____
# Create a document loader for rag_paper.pdf
loader = ____
# Load the document
data = ____
print(data[0])