Vad försöker vi förutsäga?
Vilket av dessa fält (eller kolumner) är det värde vi försöker förutsäga?
TAXESSALESCLOSEPRICEDAYSONMARKETLISTPRICE
Den här övningen är en del av kursen
Feature Engineering med PySpark
Övningsinstruktioner
- Identifiera bland kolumnerna ovan vilken som ska användas som beroende variabel
$Y$. - Använd den inlästa datamängden
dfoch filtrera den till enbart den beroende variabeln medselect(). Lagra denna dataframe i variabelnY_df. - Visa sammanfattande statistik för den beroende variabeln genom att anropa
describe()påY_dfoch sedanshow()för att visa resultatet.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Select our dependent variable
Y_df = df.____([____])
# Display summary statistics
Y_df.____().____()