ПочатиПочніть безкоштовно

Розбийте та розгорніть стовпець із текстом

Надано датафрейм clauses_df зі 100 рядками. Він має стовпець clause і ідентифікатор рядка. Кожен clause — це рядок, що містить одне або більше слів, розділених пробілами.

Ця вправа є частиною курсу

Вступ до Spark SQL у Python

Переглянути курс

Інструкції до вправи

  • Розбийте стовпець clause на стовпець words, що міститиме масив окремих слів.
  • Розгорніть стовпець words у стовпець word.
  • Підрахуйте отриману кількість рядків.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Split the clause column into a column called words 
split_df = clauses_df.select(____('clause', ' ').____('words'))
split_df.show(5, truncate=False)

# Explode the words column into a column called word 
exploded_df = split_df.____(____('____').____('word'))
exploded_df.show(10)

# Count the resulting number of rows in exploded_df
print("\nNumber of rows: ", ____)
Редагувати та запускати код