Cosa stiamo prevedendo?
Quale di questi campi (o colonne) è il valore che vogliamo prevedere?
TAXESSALESCLOSEPRICEDAYSONMARKETLISTPRICE
Questo esercizio fa parte del corso
Feature Engineering con PySpark
Istruzioni dell'esercizio
- Tra le colonne elencate sopra, individua quella che useremo come variabile dipendente
$Y$. - Usando l'insieme di dati caricato
df, filtra la variabile dipendente conselect(). Salva questo dataframe nella variabileY_df. - Mostra le statistiche riassuntive della variabile dipendente usando
describe()suY_dfe chiamandoshow()per visualizzarle.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Select our dependent variable
Y_df = df.____([____])
# Display summary statistics
Y_df.____().____()