Kom igångKom igång gratis

Visualisera saknade värden

Att visualisera saknade värden är ett effektivt sätt att snabbt få en överblick över hur mycket data som saknas. Det kan också hjälpa dig att identifiera mönster i de saknade värdena – något som behöver hanteras varsamt för att undvika skevhet i modellen.

Vilken variabel har flest saknade värden? Kör alla kodrader utom den sista för att ta reda på det. När du är säker fyller du i värdet och klickar på "Skicka in svar".

Den här övningen är en del av kursen

Feature Engineering med PySpark

Visa kurs

Övningsinstruktioner

  • Använd select() för att välja ut kolumnerna i listan columns från dataramen df, och ta ett urval med den angivna funktionen sample(). Tilldela resultatet till variabeln sample_df.
  • Konvertera den urvalsbaserade dataramen till en pandas-dataram och döp den till pandas_df. Använd sedan isnull() i pandas för att omvandla DataFrame till True/False-värden. Lagra resultatet i tf_df.
  • Använd seaborns heatmap() för att plotta tf_df.
  • Klicka på "Kör koden" för att se diagrammet. Tilldela sedan namnet på variabeln med flest saknade värden till answer.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Sample the dataframe and convert to Pandas
____ = df.select(____).sample(False, 0.1, 42)
____ = ____.toPandas()

# Convert all values to T/F
tf_df = ____.____()

# Plot it
sns.____(data=____)
plt.xticks(rotation=30, fontsize=10)
plt.yticks(rotation=0, fontsize=10)
plt.show()

# Set the answer to the column with the most missing data
answer = '____'
Redigera och kör kod