Twitter एयरलाइन सेंटिमेंट डेटा पर TfIdf
अब आप TfIdf मेथड का उपयोग करके फीचर बनाएँगे. आप tweets डेटासेट के साथ ही काम जारी रखेंगे.
इस अभ्यास में, आप पिछले लेसनों में सीखी हुई बातें लागू करेंगे: stop words हटाएँगे, एक token pattern इस्तेमाल करेंगे, और n-grams को specify करेंगे.
अंतिम आउटपुट एक DataFrame होगा, जिसके कॉलम TfidfVectorizer() से बनाए जाएँगे. ऐसा DataFrame सीधे किसी supervised learning मॉडल को पास किया जा सकता है, जिस पर हम अगले अध्याय में काम करेंगे.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Sentiment Analysis
अभ्यास निर्देश
- TfidfVectorizer बनाने और
ENGLISH_STOP_WORDSके लिए आवश्यक पैकेज इम्पोर्ट करें. tweetsडेटासेट केtextकॉलम से एक TfIdf वेक्टराइज़र बनाएँ: n-grams के रूप में uni- और bi-grams specify करें, दिए गए token pattern का उपयोग करते हुए केवल alphanumeric कैरेक्टर्स वाले टोकन लें, और stop words के रूप मेंENGLISH_STOP_WORDSसेट करें.- उसी कॉलम को specify करते हुए वेक्टराइज़र को transform करें जिस पर आपने fit किया था.
DataFrame()फंक्शन में कॉलम नाम specify करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import the required vectorizer package and stop words list
____
# Define the vectorizer and specify the arguments
my_pattern = r'\b[^\d\W][^\d\W]+\b'
vect = ____(____=(1, 2), max_features=100, ____=my_pattern, ____=ENGLISH_STOP_WORDS).fit(tweets.text)
# Transform the vectorizer
X_txt = vect.____(____.____)
# Transform to a data frame and specify the column names
X=pd.DataFrame(X_txt.toarray(), columns=____.____)
print('Top 5 rows of the DataFrame: ', X.head())