CommencerCommencez gratuitement

Utiliser des visualisations : lmplot

Créer des graphiques de modèle linéaire permet de visualiser si des variables sont liées à la variable dépendante. Si c’est le cas, elles sont de bonnes candidates à inclure dans notre analyse. Si ce n’est pas le cas, cela ne signifie pas qu’il faut les écarter ; cela implique plutôt qu’il faudra peut‑être les transformer ou les préparer avant de pouvoir les utiliser.

seaborn est disponible dans votre environnement de travail avec l’alias habituel sns.

Cet exercice fait partie du cours

<cours>Feature Engineering avec PySpark</cours>
Voir le cours

Instructions de l’exercice

  • À partir du jeu de données chargé df, ne gardez que les colonnes 'SALESCLOSEPRICE' et 'LIVINGAREA' avec select().
  • Échantillonnez 50 % du DataFrame avec sample(), sans remise et en fixant la graine aléatoire à 42.
  • Convertissez le DataFrame Spark en pandas.DataFrame() avec toPandas().
  • En utilisant 'SALESCLOSEPRICE' comme variable dépendante et 'LIVINGAREA' comme variable indépendante, tracez un graphique de modèle linéaire avec lmplot() de seaborn.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Select a the relevant columns and sample
sample_df = df.____([____, ____]).____(____, ____, ____)

# Convert to pandas dataframe
pandas_df = sample_df.____()

# Linear model plot of pandas_df
sns.____(x=____, y=____, data=____)
plt.show()
Modifier et exécuter le code