НачатьНачать бесплатно

Разбивка и разворачивание текстового столбца

Для работы предоставлен датафрейм clauses_df из 100 строк. Он содержит столбец clause и идентификатор строки. Каждый элемент clause — это строка, содержащая одно или несколько слов, разделённых пробелами.

Это упражнение является частью курса

Введение в Spark SQL на Python

Посмотреть курс

Инструкции к упражнению

  • Разбейте столбец clause на столбец words, содержащий массив отдельных слов.
  • Разверните столбец words в столбец word.
  • Подсчитайте итоговое количество строк.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Split the clause column into a column called words 
split_df = clauses_df.select(____('clause', ' ').____('words'))
split_df.show(5, truncate=False)

# Explode the words column into a column called word 
exploded_df = split_df.____(____('____').____('word'))
exploded_df.show(10)

# Count the resulting number of rows in exploded_df
print("\nNumber of rows: ", ____)
Редактировать и запускать код