शुरू करेंमुफ़्त में शुरू करें

Twitter डेटा की बड़ी मात्रा को प्रोसेस करना

कभी-कभी, हमें जिस डेटा को प्रोसेस करना होता है, उसका आकार इतना बड़ा होता है कि कंप्यूटर की मेमोरी उसे संभाल नहीं पाती. यह डेटा साइंटिस्ट्स के लिए एक आम समस्या है. इसका एक समाधान यह है कि पूरे डेटा सोर्स को एक ही बार में लोड करने के बजाय, उसे छोटे-छोटे हिस्सों (chunks) में प्रोसेस किया जाए.

इस अभ्यास में, आप यही करेंगे. आप Twitter डेटा की एक बड़ी csv फ़ाइल को उसी तरह प्रोसेस करेंगे जैसे आपने प्रीक्वेल कोर्स के Bringing it all together अभ्यासों में 'tweets.csv' को किया था, लेकिन इस बार, एक समय में 10 एंट्रीज़ के chunks पर काम करेंगे.

यदि आप यह सीखने में रुचि रखते हैं कि अपने सिस्टम पर काम करने के लिए Twitter डेटा तक कैसे पहुँचा जाए, तो DataCamp के Importing Data in Python कोर्स के Part 2 को देखें.

pandas पैकेज pd नाम से इम्पोर्ट किया जा चुका है और फ़ाइल 'tweets.csv' आपकी current directory में उपलब्ध है.

ध्यान रखें कि यह Twitter का वास्तविक डेटा है, इसलिए इसमें आपत्तिजनक भाषा या अन्य आपत्तिजनक सामग्री होने का जोखिम रहता है (इस अभ्यास में, और उन सभी अगले अभ्यासों में जो वास्तविक Twitter डेटा का उपयोग करते हैं).

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python टूलबॉक्स

पाठ्यक्रम देखें

अभ्यास निर्देश

  • Twitter डेटा को प्रोसेस करने के नतीजों को स्टोर करने के लिए एक खाली डिक्शनरी counts_dict इनिशियलाइज़ करें.
  • 'tweets.csv' फ़ाइल पर for लूप से इटेरेट करें. लूप वैरिएबल chunk का उपयोग करें और pd.read_csv() को chunksize 10 के साथ कॉल करके उस पर इटेरेट करें.
  • inner लूप में, chunk की कॉलम 'lang' पर for लूप से इटेरेट करें. लूप वैरिएबल entry का उपयोग करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Initialize an empty dictionary: counts_dict


# Iterate over the file chunk by chunk
for ____ in ____:

    # Iterate over the column in DataFrame
    for ____ in ____:
        if entry in counts_dict.keys():
            counts_dict[entry] += 1
        else:
            counts_dict[entry] = 1

# Print the populated dictionary
print(counts_dict)
कोड संपादित करें और चलाएँ