การโหลดไฟล์ HTML สำหรับ RAG
สามารถโหลดเอกสารจากหลากหลายรูปแบบได้ รวมถึงรูปแบบที่ซับซ้อนอย่าง HTML
HTML คือภาษา markup ที่ใช้สร้างหน้าเว็บ ตัวอย่างเล็กน้อยมีดังนี้:
<!DOCTYPE html>
<html>
<body>
<h2>Heading</h2>
<p>Here's some text and an image below:</p>
<img src="image.jpg" alt="..." width="104" height="142">
</body>
</html>
ในแบบฝึกหัดนี้ จะโหลดไฟล์ HTML ที่เป็นหน้าเว็บบล็อกของ DataCamp โดย class ที่จำเป็นได้ถูก import ไว้ให้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Retrieval Augmented Generation (RAG) ด้วย LangChain
คำแนะนำการฝึกหัด
- ใช้คลาส
UnstructuredHTMLLoaderเพื่อโหลดไฟล์datacamp-blog.htmlในไดเรกทอรีปัจจุบัน - โหลดเอกสารขึ้นสู่หน่วยความจำ
- แสดงผล page content ของเอกสารแรก
- แสดงผล metadata ของเอกสารแรก
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create a document loader for unstructured HTML
loader = ____
# Load the document
data = ____
# Print the first document's content
print(____)
# Print the first document's metadata
print(____)