SQL e Parquet
I file Parquet sono perfetti come archivio dati di supporto per le query SQL in Spark. Anche se è possibile eseguire le stesse query direttamente tramite le funzioni Python di Spark, a volte è più semplice eseguire query SQL accanto alle opzioni Python.
In questo esempio leggeremo il file Parquet creato nell’esercizio precedente e lo registreremo come tabella SQL. Una volta registrato, eseguiremo una rapida query sulla tabella (ovvero sul file Parquet).
L’oggetto spark e il file AA_DFW_ALL.parquet sono già a tua disposizione.
Questo esercizio fa parte del corso
Pulizia dei dati con PySpark
Istruzioni dell'esercizio
- Importa il file
AA_DFW_ALL.parquetinflights_df. - Usa il metodo
createOrReplaceTempViewper assegnare l’alias alla tabellaflights. - Esegui una query Spark SQL sulla tabella
flights.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Read the Parquet file into flights_df
flights_df = spark.read.____(____)
# Register the temp table
flights_df.____('flights')
# Run a SQL query of the average flight duration
avg_duration = spark.____('SELECT avg(flight_duration) from flights').collect()[0]
print('The average flight time is: %d' % avg_duration)