Podział na kolumny
Dane są już znacznie porządniejsze – udało się usunąć nieprawidłowe wiersze z DataFrame'a. Teraz chcesz wykonać kolejne przekształcenia: wygenerować konkretne, znaczące kolumny na podstawie zawartości DataFrame'a.
Masz dostęp do kontekstu spark oraz do najnowszej wersji DataFrame'a annotations_df. Biblioteka pyspark.sql.functions jest dostępna pod aliasem F.
To ćwiczenie jest częścią kursu
Czyszczenie danych w PySpark
Instrukcje do ćwiczenia
- Podziel zawartość kolumny
'_c0'według znaku tabulacji i zapisz wynik w zmiennej o nazwiesplit_cols. - Na podstawie pierwszych czterech elementów powyższej zmiennej dodaj do DataFrame'a o nazwie
split_dfnastępujące kolumny: folder, filename, width, height. - Dodaj zmienną
split_colsjako kolumnę.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Split the content of _c0 on the tab character (aka, '\t')
split_cols = ____(annotations_df['____'], '\t')
# Add the columns folder, filename, width, and height
split_df = annotations_df.withColumn('folder', split_cols.getItem(____))
split_df = split_df.withColumn('filename', ____
split_df = split_df.____
____
# Add split_cols as a column
split_df = split_df.____