CommencezCommencez gratuitement

Que cherchons-nous à prédire?

Parmi ces champs (ou colonnes), lequel correspond à la valeur que nous tentons de prédire?

  • TAXES
  • SALESCLOSEPRICE
  • DAYSONMARKET
  • LISTPRICE

Cette activité fait partie du cours

Ingénierie des caractéristiques avec PySpark

Voir le cours

Instructions de l’exercice

  • Parmi les colonnes énumérées ci-dessus, repérez celle qui servira de variable dépendante $Y$.
  • Avec l'ensemble de données chargé df, filtrez-le pour ne conserver que la variable dépendante à l'aide de select(). Stockez ce DataFrame dans la variable Y_df.
  • Affichez les statistiques sommaires de la variable dépendante en utilisant describe() sur Y_df, puis appelez show() pour les afficher.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Select our dependent variable
Y_df = df.____([____])

# Display summary statistics
Y_df.____().____()
Modifier et exécuter le code