Kom igångKom igång gratis

Dela upp i kolumner

Du har städat upp dina data avsevärt genom att ta bort ogiltiga rader från DataFrame:n. Nu vill du utföra ytterligare transformationer genom att skapa specifika, meningsfulla kolumner baserade på DataFrame:ns innehåll.

Du har spark-kontexten och den senaste versionen av annotations_df DataFrame:n. pyspark.sql.functions är tillgängligt under aliaset F.

Den här övningen är en del av kursen

Datarensning med PySpark

Visa kurs

Övningsinstruktioner

  • Dela upp innehållet i kolumnen '_c0' vid tabbtecknet och lagra resultatet i en variabel som heter split_cols.
  • Lägg till följande kolumner baserade på de fyra första elementen i variabeln ovan: folder, filename, width, height i en DataFrame med namnet split_df.
  • Lägg till variabeln split_cols som en kolumn.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Split the content of _c0 on the tab character (aka, '\t')
split_cols = ____(annotations_df['____'], '\t')

# Add the columns folder, filename, width, and height
split_df = annotations_df.withColumn('folder', split_cols.getItem(____))
split_df = split_df.withColumn('filename', ____
split_df = split_df.____
____

# Add split_cols as a column
split_df = split_df.____
Redigera och kör kod