Rozdělení do sloupců
Data jsi už pořádně vyčistil/a – neplatné řádky jsou z DataFrame pryč. Teď chceš provést další transformace a z obsahu DataFrame vytvořit konkrétní smysluplné sloupce.
Máš k dispozici kontext spark a nejnovější verzi DataFrame annotations_df. Knihovna pyspark.sql.functions je dostupná pod aliasem F.
Toto cvičení je součástí kurzu
Cleaning Data with PySpark
Pokyny k cvičení
- Rozděl obsah sloupce
'_c0'podle znaku tabulátoru a výsledek ulož do proměnnésplit_cols. - Na základě prvních čtyř položek výše uvedené proměnné přidej do DataFrame s názvem
split_dftyto sloupce: folder, filename, width, height. - Přidej proměnnou
split_colsjako sloupec.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Split the content of _c0 on the tab character (aka, '\t')
split_cols = ____(annotations_df['____'], '\t')
# Add the columns folder, filename, width, and height
split_df = annotations_df.withColumn('folder', split_cols.getItem(____))
split_df = split_df.withColumn('filename', ____
split_df = split_df.____
____
# Add split_cols as a column
split_df = split_df.____