डिक्शनरी और कॉर्पस बनाएँ
LDA टॉपिक मॉडल चलाने के लिए, आपको सबसे पहले अपनी डिक्शनरी और कॉर्पस परिभाषित करने होते हैं, क्योंकि इन्हें ही मॉडल में पास किया जाता है. आप पिछले अभ्यासों में तैयार किए गए क्लीन किए हुए टेक्स्ट डेटा पर ही आगे काम करेंगे. इसका मतलब text_clean आपके लिए पहले से उपलब्ध है, और आप उसी का उपयोग करके अपनी डिक्शनरी और कॉर्पस बनाएँगे.
ध्यान दें: यह अभ्यास सामान्य से थोड़ा अधिक समय ले सकता है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Fraud Detection
अभ्यास निर्देश
- gensim पैकेज और gensim से corpora को अलग-अलग इम्पोर्ट करें.
- अपनी डिक्शनरी को क्लीन डेटा
text_cleanपर सही फंक्शन चलाकर परिभाषित करें. text_cleanके हर टेक्स्ट परdoc2bowचलाकर कॉर्पस परिभाषित करें.- अपने नतीजे प्रिंट करें ताकि आप देख सकें कि
dictionaryऔरcorpusकैसे दिखते हैं.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import the packages
import ____
from ____ import ____
# Define the dictionary
dictionary = ____.____(____)
# Define the corpus
corpus = [dictionary.____(text) for ___ in ____]
# Print corpus and dictionary
print(____)
print(____)