Inizia subitoInizia gratis

Suddividere in colonne

Hai ripulito notevolmente i tuoi dati rimuovendo le righe non valide dal DataFrame. Ora vuoi eseguire ulteriori trasformazioni generando colonne specifiche e significative in base al contenuto del DataFrame.

Hai a disposizione il contesto spark e l'ultima versione del DataFrame annotations_df. pyspark.sql.functions è disponibile con l'alias F.

Questo esercizio fa parte del corso

Pulizia dei dati con PySpark

Visualizza corso

Istruzioni dell'esercizio

  • Suddividi il contenuto della colonna '_c0' sul carattere tab e memorizzalo in una variabile chiamata split_cols.
  • Aggiungi le seguenti colonne in base alle prime quattro voci della variabile sopra: folder, filename, width, height su un DataFrame chiamato split_df.
  • Aggiungi la variabile split_cols come colonna.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Split the content of _c0 on the tab character (aka, '\t')
split_cols = ____(annotations_df['____'], '\t')

# Add the columns folder, filename, width, and height
split_df = annotations_df.withColumn('folder', split_cols.getItem(____))
split_df = split_df.withColumn('filename', ____
split_df = split_df.____
____

# Add split_cols as a column
split_df = split_df.____
Modifica ed esegui il codice