Zacznij terazZacznij za darmo

Wczytywanie plików PDF do RAG

Aby rozpocząć implementację Retrieval Augmented Generation (RAG), najpierw musisz wczytać dokumenty, do których model będzie miał dostęp. Dokumenty te mogą pochodzić z różnych źródeł, a LangChain obsługuje wiele rodzajów modułów do ich ładowania.

W tym ćwiczeniu użyjesz modułu wczytującego dokumenty, aby załadować plik PDF zawierający artykuł Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks autorstwa Lewisa i in. (2021). Plik jest dostępny pod nazwą 'rag_paper.pdf'.

Uwaga: pypdf, biblioteka wymagana do wczytywania plików PDF w LangChain, jest już zainstalowana.

To ćwiczenie jest częścią kursu

Retrieval Augmented Generation (RAG) z LangChain

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj odpowiednią klasę do wczytywania dokumentów PDF w LangChain.
  • Utwórz moduł wczytujący dla dokumentu 'rag_paper.pdf'.
  • Wczytaj dokument do pamięci, aby wyświetlić zawartość pierwszego dokumentu (strony).

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import library
from langchain_community.document_loaders import ____

# Create a document loader for rag_paper.pdf
loader = ____

# Load the document
data = ____
print(data[0])
Edytuj i uruchom kod