Obliczanie procentu brakujących wartości
Automatyzacja to przyszłość data science. Warto nauczyć się automatyzować przygotowanie danych – to inwestycja, która szybko się zwraca. W tym ćwiczeniu zautomatyzujemy usuwanie kolumn, w których brakuje zbyt dużej części danych – powyżej określonego progu.
To ćwiczenie jest częścią kursu
Inżynieria cech z PySpark
Instrukcje do ćwiczenia
- Zdefiniuj funkcję
column_dropper(), która przyjmuje parametry:df– ramkę danych orazthreshold– liczbę zmiennoprzecinkową z zakresu od 0 do 1. - Oblicz odsetek brakujących wartości, korzystając z
where(),isNull()icount(). - Sprawdź, czy odsetek brakujących wartości przekracza próg – jeśli tak, usuń kolumnę za pomocą
drop(). - Uruchom
column_dropper()nadfz progiem ustawionym na 0,6.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
def column_dropper(df, threshold):
# Takes a dataframe and threshold for missing values. Returns a dataframe.
total_records = df.____()
for col in df.columns:
# Calculate the percentage of missing values
missing = df.____(df[col].____()).____()
missing_percent = ____ / ____
# Drop column if percent of missing is more than threshold
if ____ > ____:
df = df.____(col)
return df
# Drop columns that are more than 60% missing
df = ____(____, ____)