Розбийте та розгорніть стовпець із текстом
Надано датафрейм clauses_df зі 100 рядками. Він має стовпець clause і ідентифікатор рядка. Кожен clause — це рядок, що містить одне або більше слів, розділених пробілами.
Ця вправа є частиною курсу
Вступ до Spark SQL у Python
Інструкції до вправи
- Розбийте стовпець
clauseна стовпецьwords, що міститиме масив окремих слів. - Розгорніть стовпець
wordsу стовпецьword. - Підрахуйте отриману кількість рядків.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Split the clause column into a column called words
split_df = clauses_df.select(____('clause', ' ').____('words'))
split_df.show(5, truncate=False)
# Explode the words column into a column called word
exploded_df = split_df.____(____('____').____('word'))
exploded_df.show(10)
# Count the resulting number of rows in exploded_df
print("\nNumber of rows: ", ____)