कॉलम्स के एक सबसेट को इम्पोर्ट करें
Vermont टैक्स डेटा में 147 कॉलम हैं जो ZIP कोड और आय समूह के अनुसार घरेलू संरचना, आय के स्रोत, और चुकाए गए करों का वर्णन करते हैं. ज़्यादातर विश्लेषणों में इन सभी कॉलम्स की ज़रूरत नहीं होती. इस अभ्यास में, आप read_csv() के usecols आर्ग्युमेंट का उपयोग करके कम वैरिएबल्स वाला एक dataframe बनाएँगे.
आइए घरेलू संरचना पर ध्यान दें ताकि देख सकें कि भूगोल और आय स्तर के अनुसार क्या अंतर हैं. इसके लिए हमें आय समूह, ZIP कोड, टैक्स रिटर्न फाइलिंग स्टेटस (जैसे, single या married), और dependents से संबंधित कॉलम्स चाहिए. डेटा में वैरिएबल नामों के लिए कोड्स का उपयोग हुआ है, इसलिए आवश्यक विशिष्ट कॉलम्स निर्देशों में दिए गए हैं.
pandas पहले से pd नाम से इम्पोर्ट किया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
pandas के साथ सरल Data Ingestion
अभ्यास निर्देश
- जिन कॉलम्स का उपयोग करना है उनकी सूची बनाएँ:
zipcode,agi_stub(income group),mars1(single households की संख्या),MARS2(married के रूप में फाइल करने वाले households की संख्या), औरNUMDEP(dependents की संख्या). vt_tax_data_2016.csvसे केवल चुने हुए कॉलम्स का उपयोग करते हुए एक dataframe बनाएँ.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create list of columns to use
cols = ____
# Create dataframe from csv using only selected columns
data = ____("vt_tax_data_2016.csv", ____)
# View counts of dependents and tax returns by income level
print(data.groupby("agi_stub").sum())