Zacznij terazZacznij za darmo

Podział na kolumny

Dane są już znacznie porządniejsze – udało się usunąć nieprawidłowe wiersze z DataFrame'a. Teraz chcesz wykonać kolejne przekształcenia: wygenerować konkretne, znaczące kolumny na podstawie zawartości DataFrame'a.

Masz dostęp do kontekstu spark oraz do najnowszej wersji DataFrame'a annotations_df. Biblioteka pyspark.sql.functions jest dostępna pod aliasem F.

To ćwiczenie jest częścią kursu

Czyszczenie danych w PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Podziel zawartość kolumny '_c0' według znaku tabulacji i zapisz wynik w zmiennej o nazwie split_cols.
  • Na podstawie pierwszych czterech elementów powyższej zmiennej dodaj do DataFrame'a o nazwie split_df następujące kolumny: folder, filename, width, height.
  • Dodaj zmienną split_cols jako kolumnę.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Split the content of _c0 on the tab character (aka, '\t')
split_cols = ____(annotations_df['____'], '\t')

# Add the columns folder, filename, width, and height
split_df = annotations_df.withColumn('folder', split_cols.getItem(____))
split_df = split_df.withColumn('filename', ____
split_df = split_df.____
____

# Add split_cols as a column
split_df = split_df.____
Edytuj i uruchom kod