Візуалізація пропущених даних
Можливість побачити пропущені значення на графіку — чудовий спосіб швидко оцінити, якої частки даних бракує. Це також допомагає виявити, коли пропуски мають певний шаблон — у такому разі з ними слід поводитися обережно, інакше модель може бути упередженою.
У якої змінної найбільше пропусків? Запустіть усі рядки коду, крім останнього, щоб визначити відповідь. Коли будете впевнені, заповніть значення та натисніть "Надіслати відповідь".
Ця вправа є частиною курсу
Опрацювання ознак у PySpark
Інструкції до вправи
- Використайте
select(), щоб вибрати з датафреймаdfсписок стовпцівcolumns, зробіть вибірку за допомогою наданої функціїsample()і присвойте цей датафрейм зміннійsample_df. - Перетворіть цей піднабір на датафрейм
pandaspandas_dfі застосуйте вpandasisnull(), щоб отриматиDataFrameзі значеннями True/False. Збережіть результат уtf_df. - Використайте
heatmap()з бібліотеки seaborn, щоб побудувати графік дляtf_df. - Натисніть "Запустити код", щоб переглянути графік. Потім присвойте імʼя змінної з найбільшою кількістю пропусків змінній
answer.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Sample the dataframe and convert to Pandas
____ = df.select(____).sample(False, 0.1, 42)
____ = ____.toPandas()
# Convert all values to T/F
tf_df = ____.____()
# Plot it
sns.____(data=____)
plt.xticks(rotation=30, fontsize=10)
plt.yticks(rotation=0, fontsize=10)
plt.show()
# Set the answer to the column with the most missing data
answer = '____'