Charger les données
Lire des données est la première étape pour utiliser PySpark en science des données ! Profitons du nouveau standard de l'industrie : les fichiers Parquet !
Cette activité fait partie du cours
Ingénierie des caractéristiques avec PySpark
Instructions de l’exercice
- Utilisez le lecteur de fichiers
parquet()pour lire'Real_Estate.parq', comme montré dans la vidéo d'exercice. - Affichez la liste des colonnes avec
columns.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Read the file into a dataframe
df = spark.read.____(____)
# Print columns in dataframe
____(df.____)