Visualisera saknade värden
Att visualisera saknade värden är ett effektivt sätt att snabbt få en överblick över hur mycket data som saknas. Det kan också hjälpa dig att identifiera mönster i de saknade värdena – något som behöver hanteras varsamt för att undvika skevhet i modellen.
Vilken variabel har flest saknade värden? Kör alla kodrader utom den sista för att ta reda på det. När du är säker fyller du i värdet och klickar på "Skicka in svar".
Den här övningen är en del av kursen
Feature Engineering med PySpark
Övningsinstruktioner
- Använd
select()för att välja ut kolumnerna i listancolumnsfrån dataramendf, och ta ett urval med den angivna funktionensample(). Tilldela resultatet till variabelnsample_df. - Konvertera den urvalsbaserade dataramen till en
pandas-dataram och döp den tillpandas_df. Använd sedanisnull()ipandasför att omvandlaDataFrametill True/False-värden. Lagra resultatet itf_df. - Använd seaborns
heatmap()för att plottatf_df. - Klicka på "Kör koden" för att se diagrammet. Tilldela sedan namnet på variabeln med flest saknade värden till
answer.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Sample the dataframe and convert to Pandas
____ = df.select(____).sample(False, 0.1, 42)
____ = ____.toPandas()
# Convert all values to T/F
tf_df = ____.____()
# Plot it
sns.____(data=____)
plt.xticks(rotation=30, fontsize=10)
plt.yticks(rotation=0, fontsize=10)
plt.show()
# Set the answer to the column with the most missing data
answer = '____'