ПочатиПочніть безкоштовно

Візуалізація пропущених даних

Можливість побачити пропущені значення на графіку — чудовий спосіб швидко оцінити, якої частки даних бракує. Це також допомагає виявити, коли пропуски мають певний шаблон — у такому разі з ними слід поводитися обережно, інакше модель може бути упередженою.

У якої змінної найбільше пропусків? Запустіть усі рядки коду, крім останнього, щоб визначити відповідь. Коли будете впевнені, заповніть значення та натисніть "Надіслати відповідь".

Ця вправа є частиною курсу

Опрацювання ознак у PySpark

Переглянути курс

Інструкції до вправи

  • Використайте select(), щоб вибрати з датафрейма df список стовпців columns, зробіть вибірку за допомогою наданої функції sample() і присвойте цей датафрейм змінній sample_df.
  • Перетворіть цей піднабір на датафрейм pandas pandas_df і застосуйте в pandas isnull(), щоб отримати DataFrame зі значеннями True/False. Збережіть результат у tf_df.
  • Використайте heatmap() з бібліотеки seaborn, щоб побудувати графік для tf_df.
  • Натисніть "Запустити код", щоб переглянути графік. Потім присвойте імʼя змінної з найбільшою кількістю пропусків змінній answer.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Sample the dataframe and convert to Pandas
____ = df.select(____).sample(False, 0.1, 42)
____ = ____.toPandas()

# Convert all values to T/F
tf_df = ____.____()

# Plot it
sns.____(data=____)
plt.xticks(rotation=30, fontsize=10)
plt.yticks(rotation=0, fontsize=10)
plt.show()

# Set the answer to the column with the most missing data
answer = '____'
Редагувати та запускати код