Inizia subitoInizia gratis

SQL e Parquet

I file Parquet sono perfetti come archivio dati di supporto per le query SQL in Spark. Anche se è possibile eseguire le stesse query direttamente tramite le funzioni Python di Spark, a volte è più semplice eseguire query SQL accanto alle opzioni Python.

In questo esempio leggeremo il file Parquet creato nell’esercizio precedente e lo registreremo come tabella SQL. Una volta registrato, eseguiremo una rapida query sulla tabella (ovvero sul file Parquet).

L’oggetto spark e il file AA_DFW_ALL.parquet sono già a tua disposizione.

Questo esercizio fa parte del corso

Pulizia dei dati con PySpark

Visualizza corso

Istruzioni dell'esercizio

  • Importa il file AA_DFW_ALL.parquet in flights_df.
  • Usa il metodo createOrReplaceTempView per assegnare l’alias alla tabella flights.
  • Esegui una query Spark SQL sulla tabella flights.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Read the Parquet file into flights_df
flights_df = spark.read.____(____)

# Register the temp table
flights_df.____('flights')

# Run a SQL query of the average flight duration
avg_duration = spark.____('SELECT avg(flight_duration) from flights').collect()[0]
print('The average flight time is: %d' % avg_duration)
Modifica ed esegui il codice