CommencezCommencez gratuitement

Écriture dans un fichier

Dans la vidéo, vous avez vu que les fichiers sont souvent chargés dans une base de données MPP comme Redshift pour les rendre disponibles à l'analyse.

Le déroulement typique consiste à écrire les données dans des fichiers en colonnes. Ces fichiers sont ensuite téléversés vers un système de stockage et, à partir de là, ils peuvent être copiés dans l'entrepôt de données. Dans le cas d'Amazon Redshift, le système de stockage serait par exemple S3.

La première étape consiste à écrire un fichier dans le bon format. Pour cet exercice, vous choisirez le format de fichier Apache Parquet.

Vous avez dans votre espace de travail un DataFrame PySpark nommé film_sdf et un DataFrame pandas nommé film_pdf.

Cette activité fait partie du cours

Introduction à l'ingénierie des données

Voir le cours

Instructions de l’exercice

  • Écrivez le DataFrame pandas film_pdf dans un fichier Parquet nommé "films_pdf.parquet".
  • Écrivez le DataFrame PySpark film_sdf dans un fichier Parquet nommé "films_sdf.parquet".

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Write the pandas DataFrame to parquet
film_pdf.____("____")

# Write the PySpark DataFrame to parquet
film_sdf.____.____("____")
Modifier et exécuter le code