शुरू करेंमुफ़्त में शुरू करें

Python फाइलों को स्प्लिट करना

हालाँकि टेक्स्ट और कोड फाइलों में वही अक्षर होते हैं, कोड फाइलों में नैचुरल लैंग्वेज से परे विशिष्ट स्ट्रक्चर होते हैं। डॉक्यूमेंट स्प्लिटिंग के दौरान इस कोड-विशेष संदर्भ को बनाए रखने के लिए, आपको स्प्लिटर को इस तरह प्रोग्राम करना चाहिए कि वह पहले सबसे आम कोड स्ट्रक्चर पर स्प्लिट करने की कोशिश करे। सौभाग्य से, LangChain में इसके लिए तैयार फ़ंक्शनैलिटी उपलब्ध है!

आपके लिए सभी आवश्यक क्लासेज़ इम्पोर्ट कर दी गई हैं, जिनमें langchain_text_splitters से Language भी शामिल है।

यह अभ्यास पाठ्यक्रम का हिस्सा है

LangChain के साथ Retrieval Augmented Generation (RAG)

पाठ्यक्रम देखें

अभ्यास निर्देश

  • एक recursive character splitter बनाइए जो सामान्य Python कोड स्ट्रक्चर पर स्प्लिट करे.
  • python_data डॉक्यूमेंट लोडर को छोटे-छोटे चंक्स में स्प्लिट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Create a Python-aware recursive character splitter
python_splitter = RecursiveCharacterTextSplitter.____(
    ____, chunk_size=300, chunk_overlap=100
)

# Split the Python content into chunks
chunks = ____

for i, chunk in enumerate(chunks[:3]):
    print(f"Chunk {i+1}:\n{chunk.page_content}\n")
कोड संपादित करें और चलाएँ