Rozdělení a rozbalení textového sloupce
K dispozici máš dataframe clauses_df se 100 řádky. Obsahuje sloupec clause a identifikátor řádku. Každý clause je řetězec s jedním nebo více slovy oddělenými mezerami.
Toto cvičení je součástí kurzu
Úvod do Spark SQL v Pythonu
Pokyny k cvičení
- Rozděl sloupec
clausedo sloupce s názvemwords, který bude obsahovat pole jednotlivých slov. - Rozbalie sloupec
wordsdo sloupce s názvemword. - Spočítej výsledný počet řádků.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Split the clause column into a column called words
split_df = clauses_df.select(____('clause', ' ').____('words'))
split_df.show(5, truncate=False)
# Explode the words column into a column called word
exploded_df = split_df.____(____('____').____('word'))
exploded_df.show(10)
# Count the resulting number of rows in exploded_df
print("\nNumber of rows: ", ____)