Ce încercăm să prezicem?
Care dintre aceste câmpuri (sau coloane) reprezintă valoarea pe care încercăm să o prezicem?
TAXESSALESCLOSEPRICEDAYSONMARKETLISTPRICE
Acest exercițiu face parte din cursul
Feature Engineering cu PySpark
Instrucțiuni pentru exercițiu
- Din coloanele listate mai sus, identifică-o pe cea pe care o vom folosi ca variabilă dependentă
$Y$. - Folosind setul de date încărcat
df, filtrează-l pentru a păstra doar variabila dependentă cuselect(). Stochează acest dataframe în variabilaY_df. - Afișează statistici sumare pentru variabila dependentă aplicând
describe()peY_dfși apelândshow()pentru a le vizualiza.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Select our dependent variable
Y_df = df.____([____])
# Display summary statistics
Y_df.____().____()