Dela upp i kolumner
Du har städat upp dina data avsevärt genom att ta bort ogiltiga rader från DataFrame:n. Nu vill du utföra ytterligare transformationer genom att skapa specifika, meningsfulla kolumner baserade på DataFrame:ns innehåll.
Du har spark-kontexten och den senaste versionen av annotations_df DataFrame:n. pyspark.sql.functions är tillgängligt under aliaset F.
Den här övningen är en del av kursen
Datarensning med PySpark
Övningsinstruktioner
- Dela upp innehållet i kolumnen
'_c0'vid tabbtecknet och lagra resultatet i en variabel som hetersplit_cols. - Lägg till följande kolumner baserade på de fyra första elementen i variabeln ovan: folder, filename, width, height i en DataFrame med namnet
split_df. - Lägg till variabeln
split_colssom en kolumn.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Split the content of _c0 on the tab character (aka, '\t')
split_cols = ____(annotations_df['____'], '\t')
# Add the columns folder, filename, width, and height
split_df = annotations_df.withColumn('folder', split_cols.getItem(____))
split_df = split_df.withColumn('filename', ____
split_df = split_df.____
____
# Add split_cols as a column
split_df = split_df.____