Document loader สำหรับ PDF
ในการเริ่มต้นใช้งาน Retrieval Augmented Generation (RAG) สิ่งแรกที่ต้องทำคือโหลดเอกสารที่โมเดลจะใช้อ้างอิง เอกสารเหล่านี้มาได้จากหลายแหล่ง และ LangChain รองรับ document loader สำหรับแหล่งข้อมูลหลากหลายประเภท
ในแบบฝึกหัดนี้ จะได้ใช้ document loader เพื่อโหลดไฟล์ PDF ที่เป็นบทความวิจัยชื่อ RAG VS Fine-Tuning: Pipelines, Tradeoffs, and a Case Study on Agriculture โดย Balaguer et al. (2024)
หมายเหตุ: pypdf ซึ่งเป็น dependency สำหรับโหลดไฟล์ PDF ใน LangChain ได้รับการติดตั้งไว้ให้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การพัฒนาแอปพลิเคชัน LLM ด้วย LangChain
คำแนะนำการฝึกหัด
- Import คลาสที่เหมาะสมสำหรับโหลดเอกสาร PDF ใน LangChain
- สร้าง document loader สำหรับไฟล์
'rag_vs_fine_tuning.pdf'ที่อยู่ใน directory ปัจจุบัน - โหลดเอกสารเข้าสู่หน่วยความจำ แล้วดูเนื้อหาของเอกสารหรือหน้าแรก
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import library
from langchain_community.document_loaders import ____
# Create a document loader for rag_vs_fine_tuning.pdf
loader = ____
# Load the document
data = ____
print(data[0])