Začněte nyníZačněte zdarma

Vizualizace chybějících hodnot

Vizualizace chybějících hodnot je skvělý způsob, jak rychle zjistit, kolik dat ti chybí. Může také odhalit, zda chybějící hodnoty sledují nějaký vzor – a to je něco, s čím je potřeba zacházet opatrně, aby tvůj model nebyl zkreslený.

Která proměnná má nejvíce chybějících hodnot? Spusť všechny řádky kódu kromě posledního a zjisti odpověď. Až si budeš jistý/á, doplň hodnotu a klikni na "Submit Answer".

Toto cvičení je součástí kurzu

Feature Engineering with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Pomocí select() vyber z dataframu df sloupce ze seznamu columns, přidej vzorkování pomocí připravené funkce sample() a výsledek ulož do proměnné sample_df.
  • Převeď tento subset dataframe na pandas dataframe pandas_df a pomocí isnull() z pandas ho převeď na hodnoty True/False. Výsledek ulož do tf_df.
  • Pomocí seabornovy funkce heatmap() vykresli tf_df.
  • Klikni na "Run Code" a prohlédni si graf. Pak přiřaď název proměnné s nejvíce chybějícími hodnotami do answer.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Sample the dataframe and convert to Pandas
____ = df.select(____).sample(False, 0.1, 42)
____ = ____.toPandas()

# Convert all values to T/F
tf_df = ____.____()

# Plot it
sns.____(data=____)
plt.xticks(rotation=30, fontsize=10)
plt.yticks(rotation=0, fontsize=10)
plt.show()

# Set the answer to the column with the most missing data
answer = '____'
Upravit a spustit kód