CommencerCommencez gratuitement

Charger les données

Lire les données est la première étape pour utiliser PySpark en data science ! Profitons du nouveau standard du secteur : les fichiers Parquet !

Cet exercice fait partie du cours

<cours>Feature Engineering avec PySpark</cours>
Voir le cours

Instructions de l’exercice

  • Utilisez le lecteur de fichiers parquet() pour lire 'Real_Estate.parq', comme montré dans la vidéo d’exercices.
  • Affichez la liste des colonnes avec columns.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Read the file into a dataframe
df = spark.read.____(____)
# Print columns in dataframe
____(df.____)
Modifier et exécuter le code