शुरू करेंमुफ़्त में शुरू करें

डिक्शनरी और कॉर्पस बनाएँ

LDA टॉपिक मॉडल चलाने के लिए, आपको सबसे पहले अपनी डिक्शनरी और कॉर्पस परिभाषित करने होते हैं, क्योंकि इन्हें ही मॉडल में पास किया जाता है. आप पिछले अभ्यासों में तैयार किए गए क्लीन किए हुए टेक्स्ट डेटा पर ही आगे काम करेंगे. इसका मतलब text_clean आपके लिए पहले से उपलब्ध है, और आप उसी का उपयोग करके अपनी डिक्शनरी और कॉर्पस बनाएँगे.

ध्यान दें: यह अभ्यास सामान्य से थोड़ा अधिक समय ले सकता है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Fraud Detection

पाठ्यक्रम देखें

अभ्यास निर्देश

  • gensim पैकेज और gensim से corpora को अलग-अलग इम्पोर्ट करें.
  • अपनी डिक्शनरी को क्लीन डेटा text_clean पर सही फंक्शन चलाकर परिभाषित करें.
  • text_clean के हर टेक्स्ट पर doc2bow चलाकर कॉर्पस परिभाषित करें.
  • अपने नतीजे प्रिंट करें ताकि आप देख सकें कि dictionary और corpus कैसे दिखते हैं.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import the packages
import ____
from ____ import ____

# Define the dictionary
dictionary = ____.____(____)

# Define the corpus 
corpus = [dictionary.____(text) for ___ in ____]

# Print corpus and dictionary
print(____)
print(____)
कोड संपादित करें और चलाएँ