Twitter डेटा की बड़ी मात्रा को प्रोसेस करना
कभी-कभी, हमें जिस डेटा को प्रोसेस करना होता है, उसका आकार इतना बड़ा होता है कि कंप्यूटर की मेमोरी उसे संभाल नहीं पाती. यह डेटा साइंटिस्ट्स के लिए एक आम समस्या है. इसका एक समाधान यह है कि पूरे डेटा सोर्स को एक ही बार में लोड करने के बजाय, उसे छोटे-छोटे हिस्सों (chunks) में प्रोसेस किया जाए.
इस अभ्यास में, आप यही करेंगे. आप Twitter डेटा की एक बड़ी csv फ़ाइल को उसी तरह प्रोसेस करेंगे जैसे आपने प्रीक्वेल कोर्स के Bringing it all together अभ्यासों में 'tweets.csv' को किया था, लेकिन इस बार, एक समय में 10 एंट्रीज़ के chunks पर काम करेंगे.
यदि आप यह सीखने में रुचि रखते हैं कि अपने सिस्टम पर काम करने के लिए Twitter डेटा तक कैसे पहुँचा जाए, तो DataCamp के Importing Data in Python कोर्स के Part 2 को देखें.
pandas पैकेज pd नाम से इम्पोर्ट किया जा चुका है और फ़ाइल 'tweets.csv' आपकी current directory में उपलब्ध है.
ध्यान रखें कि यह Twitter का वास्तविक डेटा है, इसलिए इसमें आपत्तिजनक भाषा या अन्य आपत्तिजनक सामग्री होने का जोखिम रहता है (इस अभ्यास में, और उन सभी अगले अभ्यासों में जो वास्तविक Twitter डेटा का उपयोग करते हैं).
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python टूलबॉक्स
अभ्यास निर्देश
- Twitter डेटा को प्रोसेस करने के नतीजों को स्टोर करने के लिए एक खाली डिक्शनरी
counts_dictइनिशियलाइज़ करें. 'tweets.csv'फ़ाइल परforलूप से इटेरेट करें. लूप वैरिएबलchunkका उपयोग करें औरpd.read_csv()कोchunksize10 के साथ कॉल करके उस पर इटेरेट करें.- inner लूप में,
chunkकी कॉलम'lang'परforलूप से इटेरेट करें. लूप वैरिएबलentryका उपयोग करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Initialize an empty dictionary: counts_dict
# Iterate over the file chunk by chunk
for ____ in ____:
# Iterate over the column in DataFrame
for ____ in ____:
if entry in counts_dict.keys():
counts_dict[entry] += 1
else:
counts_dict[entry] = 1
# Print the populated dictionary
print(counts_dict)