PDF 문서 로더
Retrieval Augmented Generation(RAG)을 구현하려면 먼저 모델이 접근할 문서를 불러와야 해요. 문서는 다양한 소스에서 올 수 있으며, LangChain은 이들 대부분에 대한 문서 로더를 지원해요.
이번 연습 문제에서는 Balaguer 외(2024)의 논문 RAG VS Fine-Tuning: Pipelines, Tradeoffs, and a Case Study on Agriculture 가 담긴 PDF 문서를 문서 로더로 불러오려고 해요.
참고: LangChain에서 PDF 문서를 불러오기 위한 의존성인 pypdf는 이미 설치되어 있어요.
이 연습은 강의의 일부입니다
LangChain으로 LLM 애플리케이션 개발하기
연습 안내
- LangChain에서 PDF 문서를 불러오기 위한 적절한 클래스를 가져오세요.
- 현재 디렉터리에 있는
'rag_vs_fine_tuning.pdf'문서에 대한 문서 로더를 생성하세요. - 문서를 메모리에 로드하고 첫 번째 문서(또는 페이지)의 내용을 확인하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Import library
from langchain_community.document_loaders import ____
# Create a document loader for rag_vs_fine_tuning.pdf
loader = ____
# Load the document
data = ____
print(data[0])