Co chcemy przewidywać?
Które z tych pól (kolumn) jest wartością, którą chcemy przewidzieć?
TAXESSALESCLOSEPRICEDAYSONMARKETLISTPRICE
To ćwiczenie jest częścią kursu
Inżynieria cech z PySpark
Instrukcje do ćwiczenia
- Spośród wymienionych powyżej kolumn wskaż tę, która posłuży jako zmienna zależna
$Y$. - Korzystając z wczytanego zbioru danych
df, odfiltruj go do zmiennej zależnej za pomocąselect(). Wynik zapisz w zmiennejY_df. - Wyświetl statystyki opisowe zmiennej zależnej, wywołując
describe()naY_df, a następnieshow(), aby je pokazać.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Select our dependent variable
Y_df = df.____([____])
# Display summary statistics
Y_df.____().____()