Suddividere in colonne
Hai ripulito notevolmente i tuoi dati rimuovendo le righe non valide dal DataFrame. Ora vuoi eseguire ulteriori trasformazioni generando colonne specifiche e significative in base al contenuto del DataFrame.
Hai a disposizione il contesto spark e l'ultima versione del DataFrame annotations_df. pyspark.sql.functions è disponibile con l'alias F.
Questo esercizio fa parte del corso
Pulizia dei dati con PySpark
Istruzioni dell'esercizio
- Suddividi il contenuto della colonna
'_c0'sul carattere tab e memorizzalo in una variabile chiamatasplit_cols. - Aggiungi le seguenti colonne in base alle prime quattro voci della variabile sopra: folder, filename, width, height su un DataFrame chiamato
split_df. - Aggiungi la variabile
split_colscome colonna.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Split the content of _c0 on the tab character (aka, '\t')
split_cols = ____(annotations_df['____'], '\t')
# Add the columns folder, filename, width, and height
split_df = annotations_df.withColumn('folder', split_cols.getItem(____))
split_df = split_df.withColumn('filename', ____
split_df = split_df.____
____
# Add split_cols as a column
split_df = split_df.____