Missing Data का विज़ुअलाइज़ेशन
Missing values को प्लॉट कर पाना आपके डेटा में कितनी कमी है, यह जल्दी समझने का एक बढ़िया तरीका है. यह यह भी दिखा सकता है कि कहीं वैरिएबल्स किसी पैटर्न में तो missing नहीं हैं — ऐसी स्थिति को सावधानी से संभालना होगा, वरना आपका मॉडल biased हो सकता है.
किस वैरिएबल में सबसे ज़्यादा missing values हैं? जवाब जानने के लिए आखिरी लाइन छोड़कर बाकी सारी कोड लाइनों को चलाएँ. जब आप आश्वस्त हों, तो वह वैल्यू भरें और "Submit Answer" दबाएँ.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Feature Engineering
अभ्यास निर्देश
select()का प्रयोग करकेdfडेटाफ़्रेम को कॉलम्स की सूचीcolumnsके साथ subset करें, फिर दी गईsample()फंक्शन से sample लें, और इस डेटाफ़्रेम कोsample_dfवैरिएबल में असाइन करें.- इस subset डेटाफ़्रेम को
pandasडेटाफ़्रेमpandas_dfमें बदलें, औरpandasकेisnull()से इसDataFrameको True/False में कन्वर्ट करें. इस परिणाम कोtf_dfमें स्टोर करें. - seaborn के
heatmap()सेtf_dfको प्लॉट करें. - प्लॉट देखने के लिए "Run Code" दबाएँ. फिर जिस वैरिएबल में सबसे ज़्यादा missing values हैं, उसका नाम
answerमें असाइन करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Sample the dataframe and convert to Pandas
____ = df.select(____).sample(False, 0.1, 42)
____ = ____.toPandas()
# Convert all values to T/F
tf_df = ____.____()
# Plot it
sns.____(data=____)
plt.xticks(rotation=30, fontsize=10)
plt.yticks(rotation=0, fontsize=10)
plt.show()
# Set the answer to the column with the most missing data
answer = '____'