Wizualizacja brakujących danych
Wizualizacja brakujących wartości to świetny sposób na szybkie zorientowanie się, jak duża część danych jest niekompletna. Może też pomóc wykryć wzorce w brakujących danych – a to coś, czym trzeba zająć się z rozwagą, żeby model nie był obciążony błędem.
Która zmienna ma najwięcej brakujących wartości? Uruchom wszystkie linie kodu z wyjątkiem ostatniej, aby znaleźć odpowiedź. Gdy już będziesz mieć pewność, wpisz odpowiednią wartość i kliknij „Prześlij odpowiedź".
To ćwiczenie jest częścią kursu
Inżynieria cech z PySpark
Instrukcje do ćwiczenia
- Użyj
select(), aby wybrać kolumny z ramki danychdfwedług listycolumns, a następnie pobierz próbkę za pomocą dostarczonej funkcjisample(). Wynik przypisz do zmiennejsample_df. - Przekształć podzbiór ramki danych na ramkę danych
pandaso nazwiepandas_df, a następnie użyj metodyisnull()z bibliotekipandas, aby zamienić ją na wartości True/False. Wynik zapisz wtf_df. - Użyj funkcji
heatmap()z biblioteki seaborn, aby zwizualizowaćtf_df. - Kliknij „Uruchom kod", aby zobaczyć wykres. Następnie przypisz nazwę zmiennej z największą liczbą brakujących wartości do
answer.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Sample the dataframe and convert to Pandas
____ = df.select(____).sample(False, 0.1, 42)
____ = ____.toPandas()
# Convert all values to T/F
tf_df = ____.____()
# Plot it
sns.____(data=____)
plt.xticks(rotation=30, fontsize=10)
plt.yticks(rotation=0, fontsize=10)
plt.show()
# Set the answer to the column with the most missing data
answer = '____'