SQL et Parquet
Les fichiers Parquet sont parfaits comme magasin de données en appui aux requêtes SQL dans Spark. Même s'il est possible d'exécuter les mêmes requêtes directement avec les fonctions Python de Spark, il est parfois plus simple d'exécuter des requêtes SQL en parallèle des options Python.
Dans cet exemple, nous allons lire le fichier Parquet créé au dernier exercice et l'enregistrer comme table SQL. Une fois enregistrée, nous exécuterons une courte requête sur la table (c.-à-d. le fichier Parquet).
L'objet spark et le fichier AA_DFW_ALL.parquet sont déjà à votre disposition.
Cette activité fait partie du cours
Nettoyer des données avec PySpark
Instructions de l’exercice
- Importez le fichier
AA_DFW_ALL.parquetdansflights_df. - Utilisez la méthode
createOrReplaceTempViewpour donner l'aliasflightsà la table. - Exécutez une requête Spark SQL sur la table
flights.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Read the Parquet file into flights_df
flights_df = spark.read.____(____)
# Register the temp table
flights_df.____('flights')
# Run a SQL query of the average flight duration
avg_duration = spark.____('SELECT avg(flight_duration) from flights').collect()[0]
print('The average flight time is: %d' % avg_duration)