शुरू करेंमुफ़्त में शुरू करें

कैरक्टर के आधार पर स्प्लिटिंग

Retrieval Augmented Generation (RAG) लागू करते समय एक अहम कदम है डॉक्यूमेंट्स को ऐसे छोटे हिस्सों (chunks) में बाँटना जिन्हें वेक्टर डेटाबेस में स्टोर किया जा सके.

LangChain में स्प्लिटिंग की कई स्ट्रैटेजी उपलब्ध हैं. कुछ सरल हैं और कुछ ज़्यादा जटिल. इस अभ्यास में, आप एक character text splitter इम्प्लीमेंट करेंगे, जो कैरक्टर के आधार पर डॉक्यूमेंट्स को बाँटता है और हिस्सों की लंबाई कैरक्टरों की संख्या से नापता है.

ध्यान रखें कि कोई एक आदर्श स्प्लिटिंग स्ट्रैटेजी नहीं होती. अपने उपयोग-केस के लिए सही विकल्प खोजने के लिए आपको कुछ तरीकों पर प्रयोग करना पड़ सकता है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

LangChain के साथ LLM एप्लिकेशन विकसित करना

पाठ्यक्रम देखें

अभ्यास निर्देश

  • langchain_text_splitters से CharacterTextSplitter क्लास इम्पोर्ट करें.
  • separator="\n", chunk_size=24, और chunk_overlap=10 के साथ एक CharacterTextSplitter इंस्टेंस बनाएँ.
  • .split_text() मेथड का उपयोग करके quote को स्प्लिट करें और chunks तथा उनके lengths को प्रिंट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import the character splitter
from langchain_text_splitters import ____

quote = 'Words are flowing out like endless rain into a paper cup,\nthey slither while they pass,\nthey slip away across the universe.'
chunk_size = 24
chunk_overlap = 10

# Create an instance of the splitter class
splitter = CharacterTextSplitter(
    separator=____,
    chunk_size=____,
    chunk_overlap=____)

# Split the string and print the chunks
docs = splitter.____(quote)
print(docs)
print([len(doc) for doc in docs])
कोड संपादित करें और चलाएँ