शुरू करेंमुफ़्त में शुरू करें

spaCy के साथ Tokenization

इस अभ्यास में, आप टेक्स्ट को टोकनाइज़ करने का अभ्यास करेंगे। इसके लिए आप Amazon Fine Food Reviews डेटासेट की पहली रिव्यू का उपयोग करेंगे। इस रिव्यू तक आप दिए गए text ऑब्जेक्ट के माध्यम से पहुँच सकते हैं.

en_core_web_sm मॉडल पहले से लोड है। आप इसे nlp() कॉल करके एक्सेस कर सकते हैं। आउटपुट लिस्ट बनाने के लिए आप list comprehension का उपयोग कर सकते हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

spaCy के साथ Natural Language Processing

पाठ्यक्रम देखें

अभ्यास निर्देश

  • प्री-लोडेड रिव्यू के लिए Doc कंटेनर को document ऑब्जेक्ट में स्टोर करें.
  • document के सभी टोकन्स के टेक्स्ट को इकट्ठा करके first_text_tokens वैरिएबल में स्टोर करें और उन्हें रिव्यू करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Create a Doc container of the given text
document = ____(____)
    
# Store and review the token text values of tokens for the Doc container
first_text_tokens = [____ for ____ in ____]
print("First text tokens:\n", first_text_tokens, "\n")
कोड संपादित करें और चलाएँ