ID з різною кількістю партицій
Ви щойно додали поле ID до датафрейму. Тепер подивіться, що відбувається, якщо зробити те саме для датафреймів із різною кількістю партицій.
Щоб перевірити кількість партицій, скористайтеся методом .rdd.getNumPartitions() для датафрейму.
Сеанс spark та два датафрейми, voter_df і voter_df_single, доступні у вашому робочому середовищі. Інструкції допоможуть вам побачити різницю між цими датафреймами. Бібліотека pyspark.sql.functions доступна під псевдонімом F.
Ця вправа є частиною курсу
Очищення даних у PySpark
Інструкції до вправи
- Виведіть кількість партицій у кожному датафреймі.
- Додайте поле
ROW_IDдо кожного датафрейму. - Покажіть перші 10 ідентифікаторів у кожному датафреймі.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Print the number of partitions in each DataFrame
print("\nThere are %d partitions in the voter_df DataFrame.\n" % ____)
print("\nThere are %d partitions in the voter_df_single DataFrame.\n" % ____)
# Add a ROW_ID field to each DataFrame
voter_df = voter_df.____('ROW_ID', ____)
voter_df_single = ____
# Show the top 10 IDs in each DataFrame
voter_df.____(voter_df.____.desc()).show(____)
____.orderBy(____).show(10)