CommencezCommencez gratuitement

Utiliser des visualisations : lmplot

Créer des graphiques de modèle linéaire permet de voir si des variables sont liées à la variable dépendante. Si c'est le cas, elles sont de bonnes candidates à inclure dans notre analyse. Si ce n'est pas le cas, cela ne veut pas dire qu'il faut les écarter ; il faudra peut-être les traiter ou les transformer avant de pouvoir les utiliser.

seaborn est disponible dans votre espace de travail avec l'alias habituel sns.

Cette activité fait partie du cours

Ingénierie des caractéristiques avec PySpark

Voir le cours

Instructions de l’exercice

  • En utilisant le jeu de données chargé df, filtrez-le pour ne garder que les colonnes 'SALESCLOSEPRICE' et 'LIVINGAREA' avec select().
  • Échantillonnez 50 % du DataFrame avec sample() en vous assurant de ne pas utiliser de remise et en fixant la graine aléatoire à 42.
  • Convertissez le DataFrame Spark en pandas.DataFrame() avec toPandas().
  • En utilisant 'SALESCLOSEPRICE' comme variable dépendante et 'LIVINGAREA' comme variable indépendante, tracez un graphique de modèle linéaire avec lmplot() de seaborn.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Select a the relevant columns and sample
sample_df = df.____([____, ____]).____(____, ____, ____)

# Convert to pandas dataframe
pandas_df = sample_df.____()

# Linear model plot of pandas_df
sns.____(x=____, y=____, data=____)
plt.show()
Modifier et exécuter le code