कीवर्ड ढूँढना
किसी Twitter डेटासेट में टेक्स्ट डेटा का विश्लेषण शुरू करने के सबसे पहले तरीकों में से एक है ज्ञात कीवर्ड गिनना. इस डेटासेट में, आप डेटा साइंस से जुड़े ट्वीट्स के कलेक्शन में यह गिनेंगे कि विशेष हैशटैग कितनी बार आते हैं. इसके लिए, आप pandas Series ऑब्जेक्ट की string methods का उपयोग करेंगे.
pandas और numpy को क्रमशः pd और np नाम से इम्पोर्ट किया गया है. एक अधिक फीचर-सम्पन्न flatten_tweets और data_science_json भी आपके लिए लोड किए गए हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में सोशल मीडिया डेटा का विश्लेषण
अभ्यास निर्देश
flatten_tweets()से ट्वीट्स flatten करें और उन्हेंflat_tweetsमें स्टोर करें.- pandas DataFrame कंस्ट्रक्टर का उपयोग करके ट्वीट्स को DataFrame में कन्वर्ट करें.
'text'में#pythonके उल्लेख case-ignore करते हुए ढूँढें.pythonकोnp.sum()से sum करके और कुल ट्वीट्स की संख्या से भाग देकर#pythonका उल्लेख करने वाले ट्वीट्स का अनुपात प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Flatten the tweets and store them
____ = ____(____)
# Convert to DataFrame
ds_tweets = ____.____(____)
# Find mentions of #python in 'text'
python = ____[____].____.____(____, ____)
# Print proportion of tweets mentioning #python
print("Proportion of #python tweets:", ____ / ____)