Inizia subitoInizia gratis

ID con partizioni diverse

Hai appena aggiunto un campo ID a un DataFrame. Ora osserva cosa succede quando fai la stessa cosa su DataFrame con un numero diverso di partizioni.

Per verificare il numero di partizioni, usa il metodo .rdd.getNumPartitions() su un DataFrame.

La sessione spark e due DataFrame, voter_df e voter_df_single, sono disponibili nel tuo ambiente di lavoro. Le istruzioni ti aiuteranno a scoprire la differenza tra i DataFrame. La libreria pyspark.sql.functions è disponibile con l'alias F.

Questo esercizio fa parte del corso

Pulizia dei dati con PySpark

Visualizza corso

Istruzioni dell'esercizio

  • Stampa il numero di partizioni di ciascun DataFrame.
  • Aggiungi un campo ROW_ID a ciascun DataFrame.
  • Mostra i primi 10 ID in ciascun DataFrame.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Print the number of partitions in each DataFrame
print("\nThere are %d partitions in the voter_df DataFrame.\n" % ____)
print("\nThere are %d partitions in the voter_df_single DataFrame.\n" % ____)

# Add a ROW_ID field to each DataFrame
voter_df = voter_df.____('ROW_ID', ____)
voter_df_single = ____

# Show the top 10 IDs in each DataFrame 
voter_df.____(voter_df.____.desc()).show(____)
____.orderBy(____).show(10)
Modifica ed esegui il codice