Що ми прогнозуємо?
Яке з цих полів (або стовпців) є значенням, яке ми намагаємося спрогнозувати?
TAXESSALESCLOSEPRICEDAYSONMARKETLISTPRICE
Ця вправа є частиною курсу
Опрацювання ознак у PySpark
Інструкції до вправи
- Із наведених вище стовпців визначте, який ми використаємо як залежну змінну
$Y$. - Використовуючи завантажений набір даних
df, відфільтруйте його до нашої залежної змінної за допомогоюselect(). Збережіть цей датафрейм у зміннійY_df. - Відобразіть описову статистику для залежної змінної, застосувавши
describe()доY_dfі викликавшиshow()для показу результату.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Select our dependent variable
Y_df = df.____([____])
# Display summary statistics
Y_df.____().____()