ID con partizioni diverse
Hai appena aggiunto un campo ID a un DataFrame. Ora osserva cosa succede quando fai la stessa cosa su DataFrame con un numero diverso di partizioni.
Per verificare il numero di partizioni, usa il metodo .rdd.getNumPartitions() su un DataFrame.
La sessione spark e due DataFrame, voter_df e voter_df_single, sono disponibili nel tuo ambiente di lavoro. Le istruzioni ti aiuteranno a scoprire la differenza tra i DataFrame. La libreria pyspark.sql.functions è disponibile con l'alias F.
Questo esercizio fa parte del corso
Pulizia dei dati con PySpark
Istruzioni dell'esercizio
- Stampa il numero di partizioni di ciascun DataFrame.
- Aggiungi un campo
ROW_IDa ciascun DataFrame. - Mostra i primi 10 ID in ciascun DataFrame.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Print the number of partitions in each DataFrame
print("\nThere are %d partitions in the voter_df DataFrame.\n" % ____)
print("\nThere are %d partitions in the voter_df_single DataFrame.\n" % ____)
# Add a ROW_ID field to each DataFrame
voter_df = voter_df.____('ROW_ID', ____)
voter_df_single = ____
# Show the top 10 IDs in each DataFrame
voter_df.____(voter_df.____.desc()).show(____)
____.orderBy(____).show(10)