Bắt đầu ngayBắt đầu miễn phí

Tách tài liệu đệ quy

Tách theo một ký tự đơn lẻ thì đơn giản và dễ đoán, nhưng thường tạo ra các phần (chunk) chưa tối ưu. Trong bài này, bạn sẽ áp dụng kỹ thuật tách ký tự đệ quy để tách bài báo Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks mà bạn đã tải ở bài trước.

Nhắc lại: kỹ thuật tách ký tự đệ quy sẽ lặp qua một danh sách ký tự, lần lượt tách theo từng ký tự để xem có thể tạo các phần nhỏ hơn giới hạn chunk_size hay không.

Bài tập này là một phần của khóa học

Retrieval Augmented Generation (RAG) với LangChain

Xem khóa học

Hướng dẫn bài tập

  • Định nghĩa một bộ tách văn bản ký tự đệ quy của LangChain để tách đệ quy theo danh sách ký tự ['\n', '.', ' ', ''] với kích thước phần 75 và phần chồng lắp 10.
  • Tách document bằng text_splitter bạn đã định nghĩa và phương thức phù hợp.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

loader = PyPDFLoader("rag_paper.pdf")
document = loader.load()

# Define a text splitter that splits recursively through the character list
text_splitter = ____(
    ____,
    chunk_size=75,  
    chunk_overlap=10  
)

# Split the document using text_splitter
chunks = text_splitter.____
print(chunks)
print([len(chunk.page_content) for chunk in chunks])
Chỉnh sửa và Chạy Mã