Wat voorspellen we?
Welke van deze velden (of kolommen) is de waarde die we proberen te voorspellen?
TAXESSALESCLOSEPRICEDAYSONMARKETLISTPRICE
Deze oefening maakt deel uit van de cursus
Feature Engineering met PySpark
Oefeninstructies
- Bepaal uit de bovenstaande kolommen welke we gebruiken als onze afhankelijke variabele
$Y$. - Gebruik de geladen gegevensset
dfen filter deze naar onze afhankelijke variabele metselect(). Sla deze dataframe op in de variabeleY_df. - Toon samenvattende statistieken voor de afhankelijke variabele met
describe()opY_dfen roepshow()aan om het weer te geven.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Select our dependent variable
Y_df = df.____([____])
# Display summary statistics
Y_df.____().____()