CommencezCommencez gratuitement

SQL et Parquet

Les fichiers Parquet sont parfaits comme magasin de données en appui aux requêtes SQL dans Spark. Même s'il est possible d'exécuter les mêmes requêtes directement avec les fonctions Python de Spark, il est parfois plus simple d'exécuter des requêtes SQL en parallèle des options Python.

Dans cet exemple, nous allons lire le fichier Parquet créé au dernier exercice et l'enregistrer comme table SQL. Une fois enregistrée, nous exécuterons une courte requête sur la table (c.-à-d. le fichier Parquet).

L'objet spark et le fichier AA_DFW_ALL.parquet sont déjà à votre disposition.

Cette activité fait partie du cours

Nettoyer des données avec PySpark

Voir le cours

Instructions de l’exercice

  • Importez le fichier AA_DFW_ALL.parquet dans flights_df.
  • Utilisez la méthode createOrReplaceTempView pour donner l'alias flights à la table.
  • Exécutez une requête Spark SQL sur la table flights.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Read the Parquet file into flights_df
flights_df = spark.read.____(____)

# Register the temp table
flights_df.____('flights')

# Run a SQL query of the average flight duration
avg_duration = spark.____('SELECT avg(flight_duration) from flights').collect()[0]
print('The average flight time is: %d' % avg_duration)
Modifier et exécuter le code