Wczytywanie dokumentów PDF
Aby rozpocząć implementację Retrieval Augmented Generation (RAG), najpierw musisz wczytać dokumenty, do których model będzie miał dostęp. Mogą one pochodzić z różnych źródeł, a LangChain obsługuje loadery dokumentów dla wielu z nich.
W tym ćwiczeniu użyjesz loadera dokumentów, aby wczytać plik PDF zawierający artykuł RAG VS Fine-Tuning: Pipelines, Tradeoffs, and a Case Study on Agriculture autorstwa Balaguer i in. (2024).
Uwaga: pypdf, wymagana zależność do wczytywania dokumentów PDF w LangChain, jest już zainstalowana.
To ćwiczenie jest częścią kursu
Tworzenie aplikacji LLM z LangChain
Instrukcje do ćwiczenia
- Zaimportuj odpowiednią klasę do wczytywania dokumentów PDF w LangChain.
- Utwórz loader dokumentu dla pliku
'rag_vs_fine_tuning.pdf', który znajduje się w bieżącym katalogu. - Załaduj dokument do pamięci, aby wyświetlić zawartość pierwszego dokumentu (strony).
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import library
from langchain_community.document_loaders import ____
# Create a document loader for rag_vs_fine_tuning.pdf
loader = ____
# Load the document
data = ____
print(data[0])