डिस्ट्रिब्यूशन में मानों को हाइलाइट करना
कभी-कभी बेहतर विज़ुअलाइज़ेशन बनाने के लिए डेटा में बदलाव करना ज़रूरी होता है। मिसिंग वैल्यूज़ को संभालने के दो तरीके हैं: .dropna() और .fillna()। आप किसी कॉलम पर .quantile() का उपयोग कर एक निर्धारित पर्सेंटाइल से ऊपर या नीचे वाले एंट्रीज़ को फ़िल्टर करके आउट्लायर भी हटा सकते हैं।
आपने वीडियो में यह भी देखा कि किसी प्लॉट में किसी विशेष मान को उभारने के लिए, axes पर स्थिति x पर एक वर्टिकल लाइन जोड़ते हैं:
Axes.axvline(x=0, color=None, ...)
इस अभ्यास में, आप ग्लोबल इनकम डिस्ट्रिब्यूशन पर अंतिम नज़र डालेंगे, फिर 95वें पर्सेंटाइल से ऊपर के आउट्लायर हटाएँगे, डिस्ट्रिब्यूशन प्लॉट करेंगे, और mean तथा median दोनों मानों को हाइलाइट करेंगे। pandas as pd, seaborn as sns, और matplotlib.pyplot as plt इम्पोर्ट किए जा चुके हैं, और पिछले अभ्यासों का income DataFrame आपके वर्कस्पेस में उपलब्ध है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में वित्तीय डेटा इम्पोर्ट और मैनेज करना
अभ्यास निर्देश
- कॉलम
'Income per Capita'कोinc_per_capitaमें असाइन करें। - फ़िल्टर करके
inc_per_capitaमें केवल वे पंक्तियाँ रखें जो 95वें पर्सेंटाइल से कम हों। उसी वैरिएबल में दोबारा असाइन करें। - फ़िल्टर किए गए
inc_per_capitaके लिए डिफ़ॉल्ट हिस्टोग्राम प्लॉट करें और उसेaxमें असाइन करें। ax.axvline()का उपयोगcolor='b'के साथ करकेinc_per_capitaके mean को नीले रंग में हाइलाइट करें,ax.axvline()का उपयोगcolor='g'के साथ करके median को हरे रंग में हाइलाइट करें। परिणाम दिखाएँ!
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create inc_per_capita
inc_per_capita = ____
# Filter out incomes above the 95th percentile
inc_per_capita = inc_per_capita[____ < ____]
# Plot histogram and assign to ax
ax = ____
# Highlight mean
ax.axvline(inc_per_capita.mean(), color='b')
# Highlight median
ax.axvline(inc_per_capita.median(), color='g')
# Show the plot
plt.show()