1. Learn
  2. /
  3. Курси
  4. /
  5. Опрацювання ознак у PySpark

Connected

Вправа

Використання візуалізацій: distplot

Розуміння розподілу нашої залежної змінної дуже важливе й може впливати на вибір моделі або попередню обробку. Найкращий спосіб — побудувати графік, однак у PySpark побудова графіків не є вбудованою функцією, тож нам знадобляться проміжні кроки, щоб усе працювало коректно. У цій вправі ви візуалізуєте змінну 'LISTPRICE' і отримаєте більше уявлення про її розподіл, обчисливши коефіцієнт асиметрії (skewness).

Пакети matplotlib.pyplot і seaborn уже імпортовано з псевдонімами plt та sns.

Інструкції

100 XP
  • Виберіть 50% рядків датафрейма df за допомогою sample(), без повернення вибірок (without replacement) і з фіксацією випадкового зерна 42.
  • Перетворіть датафрейм Spark на pandas.DataFrame() за допомогою toPandas().
  • Побудуйте графік розподілу за допомогою методу distplot() з seaborn.
  • Імпортуйте функцію skewness() з pyspark.sql.functions і обчисліть її для агрегату стовпця 'LISTPRICE' методом agg(). Не забудьте виконати collect(), щоб отримати результат обчислення.