CommencerCommencez gratuitement

Que cherchons-nous à prédire ?

Parmi ces champs (ou colonnes), lequel correspond à la valeur que nous essayons de prédire ?

  • TAXES
  • SALESCLOSEPRICE
  • DAYSONMARKET
  • LISTPRICE

Cet exercice fait partie du cours

<cours>Feature Engineering avec PySpark</cours>
Voir le cours

Instructions de l’exercice

  • Parmi les colonnes listées ci-dessus, identifiez celle que nous utiliserons comme variable dépendante $Y$.
  • À partir du jeu de données chargé df, ne conservez que la variable dépendante avec select(). Stockez ce DataFrame dans la variable Y_df.
  • Affichez les statistiques descriptives de la variable dépendante en utilisant describe() sur Y_df, puis appelez show() pour les afficher.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Select our dependent variable
Y_df = df.____([____])

# Display summary statistics
Y_df.____().____()
Modifier et exécuter le code