Inizia subitoInizia gratis

Salvare un DataFrame in formato Parquet

Quando lavori con Spark, spesso parti da CSV, JSON o altre sorgenti dati. Questo offre molta flessibilità nei tipi di dati da caricare, ma non è il formato ottimale per Spark. Il formato Parquet è un archivio dati colonnare che consente a Spark di usare il predicate pushdown. In pratica, Spark elabora solo i dati necessari per completare le operazioni che definisci, invece di leggere l’intero insieme di dati. Questo dà a Spark maggiore flessibilità nell’accesso ai dati e spesso migliora drasticamente le prestazioni su insiemi di dati di grandi dimensioni.

In questo esercizio, praticherai la creazione di un nuovo file Parquet e l’elaborazione di alcuni dati da esso.

L’oggetto spark e i DataFrame df1 e df2 sono già stati predisposti per te.

Questo esercizio fa parte del corso

Pulizia dei dati con PySpark

Visualizza corso

Istruzioni dell'esercizio

  • Visualizza il numero di righe di df1 e df2.
  • Combina df1 e df2 in un nuovo DataFrame chiamato df3 usando il metodo union.
  • Salva df3 in un file parquet chiamato AA_DFW_ALL.parquet.
  • Leggi il file AA_DFW_ALL.parquet e mostra il conteggio.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# View the row count of df1 and df2
print("df1 Count: %d" % df1.____())
print("df2 Count: %d" % ____.____())

# Combine the DataFrames into one
df3 = df1.union(df2)

# Save the df3 DataFrame in Parquet format
df3.____.____('AA_DFW_ALL.parquet', mode='overwrite')

# Read the Parquet file into a new DataFrame and run a count
print(spark.read.____('AA_DFW_ALL.parquet').count())
Modifica ed esegui il codice