शुरू करेंमुफ़्त में शुरू करें

HTML को स्प्लिट करना

इस अभ्यास में, आप एक HTML फ़ाइल को स्प्लिट करेंगे जिसमें अक्टूबर 2023 में US White House द्वारा जारी AI पर एक Executive Order है। चंक्स में यथासंभव अधिक संदर्भ बनाए रखने के लिए, आप बड़े chunk_size और chunk_overlap मानों का उपयोग करेंगे.

इस अभ्यास को पूरा करने के लिए आवश्यक सभी LangChain क्लासेज़ पहले से लोड कर दी गई हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

LangChain के साथ LLM एप्लिकेशन विकसित करना

पाठ्यक्रम देखें

अभ्यास निर्देश

  • white_house_executive_order_nov_2023.html के लिए एक UnstructuredHTMLLoader बनाएँ, और उसे मेमोरी में लोड करें.
  • chunk_size को 300 और chunk_overlap को 100 सेट करें.
  • '.' कैरेक्टर पर स्प्लिट करने के लिए एक RecursiveCharacterTextSplitter बनाएँ, और .split_documents() मेथड का उपयोग करके data को स्प्लिट करें और चंक्स प्रिंट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Load the HTML document into memory
loader = UnstructuredHTMLLoader(____)
data = loader.____()

# Define variables
chunk_size = ____
chunk_overlap = ____

# Split the HTML
splitter = RecursiveCharacterTextSplitter(
    chunk_size=chunk_size,
    chunk_overlap=chunk_overlap,
    separators=____)

docs = splitter.____(data)
print(docs)
कोड संपादित करें और चलाएँ