Tách tài liệu đệ quy
Tách theo một ký tự đơn lẻ thì đơn giản và dễ đoán, nhưng thường tạo ra các phần (chunk) chưa tối ưu. Trong bài này, bạn sẽ áp dụng kỹ thuật tách ký tự đệ quy để tách bài báo Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks mà bạn đã tải ở bài trước.
Nhắc lại: kỹ thuật tách ký tự đệ quy sẽ lặp qua một danh sách ký tự, lần lượt tách theo từng ký tự để xem có thể tạo các phần nhỏ hơn giới hạn chunk_size hay không.
Bài tập này là một phần của khóa học
Retrieval Augmented Generation (RAG) với LangChain
Hướng dẫn bài tập
- Định nghĩa một bộ tách văn bản ký tự đệ quy của LangChain để tách đệ quy theo danh sách ký tự
['\n', '.', ' ', '']với kích thước phần75và phần chồng lắp10. - Tách
documentbằngtext_splitterbạn đã định nghĩa và phương thức phù hợp.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
loader = PyPDFLoader("rag_paper.pdf")
document = loader.load()
# Define a text splitter that splits recursively through the character list
text_splitter = ____(
____,
chunk_size=75,
chunk_overlap=10
)
# Split the document using text_splitter
chunks = text_splitter.____
print(chunks)
print([len(chunk.page_content) for chunk in chunks])