Fehlenden-Prozentanteil berechnen
Automatisierung ist die Zukunft der Data Science. Wenn du Teile deiner Datenvorbereitung automatisierst, zahlt sich das aus. In dieser Übung automatisieren wir das Entfernen von Spalten, wenn ihnen über einem bestimmten Schwellenwert Daten fehlen.
Diese Übung ist Teil des Kurses
<Kurs>Feature Engineering mit PySpark</Kurs>Übungsanweisungen
- Definiere eine Funktion
column_dropper(), die die Parameterdf(ein DataFrame) undthreshold(ein Float zwischen 0 und 1) entgegennimmt. - Berechne den Prozentsatz fehlender Werte mit
where(),isNull()undcount(). - Prüfe, ob der Prozentsatz der fehlenden Werte höher als der Schwellenwert ist; falls ja, entferne die Spalte mit
drop(). - Führe
column_dropper()aufdfmit einem Schwellenwert von 0.6 aus.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
def column_dropper(df, threshold):
# Takes a dataframe and threshold for missing values. Returns a dataframe.
total_records = df.____()
for col in df.columns:
# Calculate the percentage of missing values
missing = df.____(df[col].____()).____()
missing_percent = ____ / ____
# Drop column if percent of missing is more than threshold
if ____ > ____:
df = df.____(col)
return df
# Drop columns that are more than 60% missing
df = ____(____, ____)