Podział i rozwinięcie kolumny tekstowej
Dostępna jest ramka danych clauses_df zawierająca 100 wierszy. Ma ona kolumnę clause oraz identyfikator wiersza. Każda wartość clause to ciąg znaków zawierający jedno lub więcej słów oddzielonych spacjami.
To ćwiczenie jest częścią kursu
Wprowadzenie do Spark SQL w Pythonie
Instrukcje do ćwiczenia
- Podziel kolumnę
clausena kolumnę o nazwiewords, zawierającą tablicę pojedynczych słów. - Rozwiń kolumnę
wordsdo kolumny o nazwieword. - Zlicz wynikową liczbę wierszy.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Split the clause column into a column called words
split_df = clauses_df.select(____('clause', ' ').____('words'))
split_df.show(5, truncate=False)
# Explode the words column into a column called word
exploded_df = split_df.____(____('____').____('word'))
exploded_df.show(10)
# Count the resulting number of rows in exploded_df
print("\nNumber of rows: ", ____)