Aan de slagBegin gratis

Wat voorspellen we?

Welke van deze velden (of kolommen) is de waarde die we proberen te voorspellen?

  • TAXES
  • SALESCLOSEPRICE
  • DAYSONMARKET
  • LISTPRICE

Deze oefening maakt deel uit van de cursus

Feature Engineering met PySpark

Bekijk cursus

Oefeninstructies

  • Bepaal uit de bovenstaande kolommen welke we gebruiken als onze afhankelijke variabele $Y$.
  • Gebruik de geladen gegevensset df en filter deze naar onze afhankelijke variabele met select(). Sla deze dataframe op in de variabele Y_df.
  • Toon samenvattende statistieken voor de afhankelijke variabele met describe() op Y_df en roep show() aan om het weer te geven.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Select our dependent variable
Y_df = df.____([____])

# Display summary statistics
Y_df.____().____()
Code bewerken en uitvoeren