Zacznij terazZacznij za darmo

Wizualizacja brakujących danych

Wizualizacja brakujących wartości to świetny sposób na szybkie zorientowanie się, jak duża część danych jest niekompletna. Może też pomóc wykryć wzorce w brakujących danych – a to coś, czym trzeba zająć się z rozwagą, żeby model nie był obciążony błędem.

Która zmienna ma najwięcej brakujących wartości? Uruchom wszystkie linie kodu z wyjątkiem ostatniej, aby znaleźć odpowiedź. Gdy już będziesz mieć pewność, wpisz odpowiednią wartość i kliknij „Prześlij odpowiedź".

To ćwiczenie jest częścią kursu

Inżynieria cech z PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Użyj select(), aby wybrać kolumny z ramki danych df według listy columns, a następnie pobierz próbkę za pomocą dostarczonej funkcji sample(). Wynik przypisz do zmiennej sample_df.
  • Przekształć podzbiór ramki danych na ramkę danych pandas o nazwie pandas_df, a następnie użyj metody isnull() z biblioteki pandas, aby zamienić ją na wartości True/False. Wynik zapisz w tf_df.
  • Użyj funkcji heatmap() z biblioteki seaborn, aby zwizualizować tf_df.
  • Kliknij „Uruchom kod", aby zobaczyć wykres. Następnie przypisz nazwę zmiennej z największą liczbą brakujących wartości do answer.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Sample the dataframe and convert to Pandas
____ = df.select(____).sample(False, 0.1, 42)
____ = ____.toPandas()

# Convert all values to T/F
tf_df = ____.____()

# Plot it
sns.____(data=____)
plt.xticks(rotation=30, fontsize=10)
plt.yticks(rotation=0, fontsize=10)
plt.show()

# Set the answer to the column with the most missing data
answer = '____'
Edytuj i uruchom kod