Zacznij terazZacznij za darmo

Podział i rozwinięcie kolumny tekstowej

Dostępna jest ramka danych clauses_df zawierająca 100 wierszy. Ma ona kolumnę clause oraz identyfikator wiersza. Każda wartość clause to ciąg znaków zawierający jedno lub więcej słów oddzielonych spacjami.

To ćwiczenie jest częścią kursu

Wprowadzenie do Spark SQL w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Podziel kolumnę clause na kolumnę o nazwie words, zawierającą tablicę pojedynczych słów.
  • Rozwiń kolumnę words do kolumny o nazwie word.
  • Zlicz wynikową liczbę wierszy.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Split the clause column into a column called words 
split_df = clauses_df.select(____('clause', ' ').____('words'))
split_df.show(5, truncate=False)

# Explode the words column into a column called word 
exploded_df = split_df.____(____('____').____('word'))
exploded_df.show(10)

# Count the resulting number of rows in exploded_df
print("\nNumber of rows: ", ____)
Edytuj i uruchom kod