शुरू करेंमुफ़्त में शुरू करें

Missing Data का विज़ुअलाइज़ेशन

Missing values को प्लॉट कर पाना आपके डेटा में कितनी कमी है, यह जल्दी समझने का एक बढ़िया तरीका है. यह यह भी दिखा सकता है कि कहीं वैरिएबल्स किसी पैटर्न में तो missing नहीं हैं — ऐसी स्थिति को सावधानी से संभालना होगा, वरना आपका मॉडल biased हो सकता है.

किस वैरिएबल में सबसे ज़्यादा missing values हैं? जवाब जानने के लिए आखिरी लाइन छोड़कर बाकी सारी कोड लाइनों को चलाएँ. जब आप आश्वस्त हों, तो वह वैल्यू भरें और "Submit Answer" दबाएँ.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Feature Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • select() का प्रयोग करके df डेटाफ़्रेम को कॉलम्स की सूची columns के साथ subset करें, फिर दी गई sample() फंक्शन से sample लें, और इस डेटाफ़्रेम को sample_df वैरिएबल में असाइन करें.
  • इस subset डेटाफ़्रेम को pandas डेटाफ़्रेम pandas_df में बदलें, और pandas के isnull() से इस DataFrame को True/False में कन्वर्ट करें. इस परिणाम को tf_df में स्टोर करें.
  • seaborn के heatmap() से tf_df को प्लॉट करें.
  • प्लॉट देखने के लिए "Run Code" दबाएँ. फिर जिस वैरिएबल में सबसे ज़्यादा missing values हैं, उसका नाम answer में असाइन करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Sample the dataframe and convert to Pandas
____ = df.select(____).sample(False, 0.1, 42)
____ = ____.toPandas()

# Convert all values to T/F
tf_df = ____.____()

# Plot it
sns.____(data=____)
plt.xticks(rotation=30, fontsize=10)
plt.yticks(rotation=0, fontsize=10)
plt.show()

# Set the answer to the column with the most missing data
answer = '____'
कोड संपादित करें और चलाएँ