Twitter टेक्स्ट एनालिसिस की एक छोटी-सी शुरुआत
अब जब आपका ट्वीट्स वाला DataFrame तैयार है, तो आप थोड़ा-सा टेक्स्ट एनालिसिस करेंगे ताकि गिना जा सके कि कितने ट्वीट्स में 'clinton', 'trump', 'sanders' और 'cruz' शब्द आते हैं। प्री-एक्सरसाइज़ कोड में, हमने नीचे दिया गया फंक्शन word_in_text() परिभाषित किया है, जो बताएगा कि पहला आर्ग्युमेंट (एक शब्द) दूसरे आर्ग्युमेंट (एक ट्वीट) के अंदर मौजूद है या नहीं.
import re
def word_in_text(word, text):
word = word.lower()
text = text.lower()
match = re.search(word, text)
if match:
return True
return False
आप DataFrame की पंक्तियों पर iterate करेंगे और गणना करेंगे कि हमारे प्रत्येक कीवर्ड वाले कितने ट्वीट्स हैं! प्रत्येक उम्मीदवार के लिए ऑब्जेक्ट्स की सूची 0 से initialize कर दी गई है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
इंटरमीडिएट Importing Data in Python
अभ्यास निर्देश
forलूपfor index, row in df.iterrows():के भीतर, वर्तमान कोड हर बार किसी ट्वीट (text पंक्ति) में 'Clinton' का ज़िक्र मिलने परclintonका मान1से बढ़ा देता है; कोड को पूरा करें ताकि यही कामtrump,sandersऔरcruzके लिए भी हो.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Initialize list to store tweet counts
[clinton, trump, sanders, cruz] = [0, 0, 0, 0]
# Iterate through df, counting the number of tweets in which
# each candidate is mentioned
for index, row in df.iterrows():
clinton += word_in_text('clinton', row['text'])
trump += word_in_text(____, ____)
sanders += word_in_text(____, ____)
cruz += word_in_text(____, ____)