डेटा को चंक्स में लोड करने के लिए एक iterator लिखना (2)
पिछले अभ्यास में, आपने read_csv() का उपयोग करके एक बड़े डेटासेट से DataFrame चंक्स पढ़े थे। इस अभ्यास में, आप बड़े DataFrame chunk size के साथ फ़ाइल पढ़ेंगे और फिर पहले chunk के डेटा को प्रोसेस करेंगे.
डेटा प्रोसेस करने के लिए, आप एक और DataFrame बनाएँगे जिसमें केवल किसी विशेष देश की पंक्तियाँ होंगी। इसके बाद आप नए DataFrame की दो कॉलम, 'Total Population' और 'Urban population (% of total)', को आपस में zip करेंगे। अंत में, आप zip ऑब्जेक्ट से tuples की एक लिस्ट बनाएँगे, जहाँ हर tuple में इन दोनों कॉलमों में से एक-एक मान होगा.
आप 'ind_pop_data.csv' से डेटा उपयोग करने जा रहे हैं, जो आपकी current डायरेक्टरी में उपलब्ध है। pandas को pd के रूप में इम्पोर्ट किया जा चुका है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python टूलबॉक्स
अभ्यास निर्देश
pd.read_csv()का उपयोग करके'ind_pop_data.csv'फ़ाइल को1000साइज़ के चंक्स में पढ़ें। परिणाम कोurb_pop_readerमें असाइन करें.- iterable
urb_pop_readerसे पहला DataFrame chunk लें और उसेdf_urb_popमें असाइन करें. df_urb_popकी सिर्फ वही पंक्तियाँ चुनें जिनका'CountryCode''CEB'हो। ऐसा करने के लिए,df_urb_pop[____]में स्क्वेयर ब्रैकेट्स के भीतर जाँचें किdf_urb_pop['CountryCode']'CEB'के बराबर है.zip()का उपयोग करते हुए,df_pop_cebकी'Total Population'और'Urban population (% of total)'कॉलम को साथ में zip करें। प्राप्त zip ऑब्जेक्ट कोpopsमें असाइन करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Initialize reader object: urb_pop_reader
urb_pop_reader = pd.read_csv(____, ____)
# Get the first DataFrame chunk: df_urb_pop
df_urb_pop = next(____)
# Check out the head of the DataFrame
print(df_urb_pop.head())
# Check out specific country: df_pop_ceb
df_pop_ceb = df_urb_pop[____]
# Zip DataFrame columns of interest: pops
pops = zip(____, ____)
# Turn zip object into list: pops_list
pops_list = list(pops)
# Print pops_list
print(pops_list)