ПочатиПочніть безкоштовно

Що ми прогнозуємо?

Яке з цих полів (або стовпців) є значенням, яке ми намагаємося спрогнозувати?

  • TAXES
  • SALESCLOSEPRICE
  • DAYSONMARKET
  • LISTPRICE

Ця вправа є частиною курсу

Опрацювання ознак у PySpark

Переглянути курс

Інструкції до вправи

  • Із наведених вище стовпців визначте, який ми використаємо як залежну змінну $Y$.
  • Використовуючи завантажений набір даних df, відфільтруйте його до нашої залежної змінної за допомогою select(). Збережіть цей датафрейм у змінній Y_df.
  • Відобразіть описову статистику для залежної змінної, застосувавши describe() до Y_df і викликавши show() для показу результату.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Select our dependent variable
Y_df = df.____([____])

# Display summary statistics
Y_df.____().____()
Редагувати та запускати код