ПочатиПочніть безкоштовно

ID з різною кількістю партицій

Ви щойно додали поле ID до датафрейму. Тепер подивіться, що відбувається, якщо зробити те саме для датафреймів із різною кількістю партицій.

Щоб перевірити кількість партицій, скористайтеся методом .rdd.getNumPartitions() для датафрейму.

Сеанс spark та два датафрейми, voter_df і voter_df_single, доступні у вашому робочому середовищі. Інструкції допоможуть вам побачити різницю між цими датафреймами. Бібліотека pyspark.sql.functions доступна під псевдонімом F.

Ця вправа є частиною курсу

Очищення даних у PySpark

Переглянути курс

Інструкції до вправи

  • Виведіть кількість партицій у кожному датафреймі.
  • Додайте поле ROW_ID до кожного датафрейму.
  • Покажіть перші 10 ідентифікаторів у кожному датафреймі.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Print the number of partitions in each DataFrame
print("\nThere are %d partitions in the voter_df DataFrame.\n" % ____)
print("\nThere are %d partitions in the voter_df_single DataFrame.\n" % ____)

# Add a ROW_ID field to each DataFrame
voter_df = voter_df.____('ROW_ID', ____)
voter_df_single = ____

# Show the top 10 IDs in each DataFrame 
voter_df.____(voter_df.____.desc()).show(____)
____.orderBy(____).show(10)
Редагувати та запускати код