Écriture dans un fichier
Dans la vidéo, vous avez vu que les fichiers sont souvent chargés dans une base de données MPP comme Redshift pour les rendre disponibles à l'analyse.
Le déroulement typique consiste à écrire les données dans des fichiers en colonnes. Ces fichiers sont ensuite téléversés vers un système de stockage et, à partir de là, ils peuvent être copiés dans l'entrepôt de données. Dans le cas d'Amazon Redshift, le système de stockage serait par exemple S3.
La première étape consiste à écrire un fichier dans le bon format. Pour cet exercice, vous choisirez le format de fichier Apache Parquet.
Vous avez dans votre espace de travail un DataFrame PySpark nommé film_sdf et un DataFrame pandas nommé film_pdf.
Cette activité fait partie du cours
Introduction à l'ingénierie des données
Instructions de l’exercice
- Écrivez le DataFrame
pandasfilm_pdfdans un fichier Parquet nommé"films_pdf.parquet". - Écrivez le DataFrame PySpark
film_sdfdans un fichier Parquet nommé"films_sdf.parquet".
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Write the pandas DataFrame to parquet
film_pdf.____("____")
# Write the PySpark DataFrame to parquet
film_sdf.____.____("____")