Vizualizace chybějících hodnot
Vizualizace chybějících hodnot je skvělý způsob, jak rychle zjistit, kolik dat ti chybí. Může také odhalit, zda chybějící hodnoty sledují nějaký vzor – a to je něco, s čím je potřeba zacházet opatrně, aby tvůj model nebyl zkreslený.
Která proměnná má nejvíce chybějících hodnot? Spusť všechny řádky kódu kromě posledního a zjisti odpověď. Až si budeš jistý/á, doplň hodnotu a klikni na "Submit Answer".
Toto cvičení je součástí kurzu
Feature Engineering with PySpark
Pokyny k cvičení
- Pomocí
select()vyber z dataframudfsloupce ze seznamucolumns, přidej vzorkování pomocí připravené funkcesample()a výsledek ulož do proměnnésample_df. - Převeď tento subset dataframe na
pandasdataframepandas_dfa pomocíisnull()zpandasho převeď na hodnoty True/False. Výsledek ulož dotf_df. - Pomocí seabornovy funkce
heatmap()vykreslitf_df. - Klikni na "Run Code" a prohlédni si graf. Pak přiřaď název proměnné s nejvíce chybějícími hodnotami do
answer.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Sample the dataframe and convert to Pandas
____ = df.select(____).sample(False, 0.1, 42)
____ = ____.toPandas()
# Convert all values to T/F
tf_df = ____.____()
# Plot it
sns.____(data=____)
plt.xticks(rotation=30, fontsize=10)
plt.yticks(rotation=0, fontsize=10)
plt.show()
# Set the answer to the column with the most missing data
answer = '____'