Разбивка и разворачивание текстового столбца
Для работы предоставлен датафрейм clauses_df из 100 строк. Он содержит столбец clause и идентификатор строки. Каждый элемент clause — это строка, содержащая одно или несколько слов, разделённых пробелами.
Это упражнение является частью курса
Введение в Spark SQL на Python
Инструкции к упражнению
- Разбейте столбец
clauseна столбецwords, содержащий массив отдельных слов. - Разверните столбец
wordsв столбецword. - Подсчитайте итоговое количество строк.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Split the clause column into a column called words
split_df = clauses_df.select(____('clause', ' ').____('words'))
split_df.show(5, truncate=False)
# Explode the words column into a column called word
exploded_df = split_df.____(____('____').____('word'))
exploded_df.show(10)
# Count the resulting number of rows in exploded_df
print("\nNumber of rows: ", ____)