Začněte nyníZačněte zdarma

Rozdělení do sloupců

Data jsi už pořádně vyčistil/a – neplatné řádky jsou z DataFrame pryč. Teď chceš provést další transformace a z obsahu DataFrame vytvořit konkrétní smysluplné sloupce.

Máš k dispozici kontext spark a nejnovější verzi DataFrame annotations_df. Knihovna pyspark.sql.functions je dostupná pod aliasem F.

Toto cvičení je součástí kurzu

Cleaning Data with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Rozděl obsah sloupce '_c0' podle znaku tabulátoru a výsledek ulož do proměnné split_cols.
  • Na základě prvních čtyř položek výše uvedené proměnné přidej do DataFrame s názvem split_df tyto sloupce: folder, filename, width, height.
  • Přidej proměnnou split_cols jako sloupec.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Split the content of _c0 on the tab character (aka, '\t')
split_cols = ____(annotations_df['____'], '\t')

# Add the columns folder, filename, width, and height
split_df = annotations_df.withColumn('folder', split_cols.getItem(____))
split_df = split_df.withColumn('filename', ____
split_df = split_df.____
____

# Add split_cols as a column
split_df = split_df.____
Upravit a spustit kód