Salvare un DataFrame in formato Parquet
Quando lavori con Spark, spesso parti da CSV, JSON o altre sorgenti dati. Questo offre molta flessibilità nei tipi di dati da caricare, ma non è il formato ottimale per Spark. Il formato Parquet è un archivio dati colonnare che consente a Spark di usare il predicate pushdown. In pratica, Spark elabora solo i dati necessari per completare le operazioni che definisci, invece di leggere l’intero insieme di dati. Questo dà a Spark maggiore flessibilità nell’accesso ai dati e spesso migliora drasticamente le prestazioni su insiemi di dati di grandi dimensioni.
In questo esercizio, praticherai la creazione di un nuovo file Parquet e l’elaborazione di alcuni dati da esso.
L’oggetto spark e i DataFrame df1 e df2 sono già stati predisposti per te.
Questo esercizio fa parte del corso
Pulizia dei dati con PySpark
Istruzioni dell'esercizio
- Visualizza il numero di righe di
df1edf2. - Combina
df1edf2in un nuovo DataFrame chiamatodf3usando il metodounion. - Salva
df3in un fileparquetchiamatoAA_DFW_ALL.parquet. - Leggi il file
AA_DFW_ALL.parquete mostra il conteggio.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# View the row count of df1 and df2
print("df1 Count: %d" % df1.____())
print("df2 Count: %d" % ____.____())
# Combine the DataFrames into one
df3 = df1.union(df2)
# Save the df3 DataFrame in Parquet format
df3.____.____('AA_DFW_ALL.parquet', mode='overwrite')
# Read the Parquet file into a new DataFrame and run a count
print(spark.read.____('AA_DFW_ALL.parquet').count())