Začněte nyníZačněte zdarma

Rozdělení a rozbalení textového sloupce

K dispozici máš dataframe clauses_df se 100 řádky. Obsahuje sloupec clause a identifikátor řádku. Každý clause je řetězec s jedním nebo více slovy oddělenými mezerami.

Toto cvičení je součástí kurzu

Úvod do Spark SQL v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Rozděl sloupec clause do sloupce s názvem words, který bude obsahovat pole jednotlivých slov.
  • Rozbalie sloupec words do sloupce s názvem word.
  • Spočítej výsledný počet řádků.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Split the clause column into a column called words 
split_df = clauses_df.select(____('clause', ' ').____('words'))
split_df.show(5, truncate=False)

# Explode the words column into a column called word 
exploded_df = split_df.____(____('____').____('word'))
exploded_df.show(10)

# Count the resulting number of rows in exploded_df
print("\nNumber of rows: ", ____)
Upravit a spustit kód