Výpočet podílu chybějících hodnot
Automatizace je budoucnost datové vědy. Naučit se automatizovat přípravu dat se ti rozhodně vyplatí. V tomto cvičení si napíšeš funkci, která automaticky odstraní sloupce s příliš velkým podílem chybějících hodnot – podle zadaného prahu.
Toto cvičení je součástí kurzu
Feature Engineering with PySpark
Pokyny k cvičení
- Definuj funkci
column_dropper(), která přijme parametrydf(datový rámec) athreshold(desetinné číslo od 0 do 1). - Spočítej podíl chybějících hodnot pomocí
where(),isNull()acount(). - Zkontroluj, jestli je podíl chybějících hodnot vyšší než prahová hodnota – pokud ano, odstraň sloupec pomocí
drop(). - Spusť
column_dropper()nadfs prahem nastaveným na .6.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
def column_dropper(df, threshold):
# Takes a dataframe and threshold for missing values. Returns a dataframe.
total_records = df.____()
for col in df.columns:
# Calculate the percentage of missing values
missing = df.____(df[col].____()).____()
missing_percent = ____ / ____
# Drop column if percent of missing is more than threshold
if ____ > ____:
df = df.____(col)
return df
# Drop columns that are more than 60% missing
df = ____(____, ____)