НачатьНачать бесплатно

Идентификаторы при разном числе разделов

Вы только что научились добавлять поле с идентификатором в DataFrame. Теперь посмотрим, что происходит, когда то же самое выполняется на DataFrame с разным количеством разделов.

Чтобы узнать количество разделов, используйте метод .rdd.getNumPartitions() для DataFrame.

В вашем рабочем пространстве доступны сессия spark и два DataFrame — voter_df и voter_df_single. Следуйте инструкциям, чтобы выявить различия между ними. Библиотека pyspark.sql.functions доступна под псевдонимом F.

Это упражнение является частью курса

Очистка данных с помощью PySpark

Посмотреть курс

Инструкции к упражнению

  • Выведите количество разделов для каждого DataFrame.
  • Добавьте поле ROW_ID в каждый DataFrame.
  • Покажите первые 10 идентификаторов из каждого DataFrame.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Print the number of partitions in each DataFrame
print("\nThere are %d partitions in the voter_df DataFrame.\n" % ____)
print("\nThere are %d partitions in the voter_df_single DataFrame.\n" % ____)

# Add a ROW_ID field to each DataFrame
voter_df = voter_df.____('ROW_ID', ____)
voter_df_single = ____

# Show the top 10 IDs in each DataFrame 
voter_df.____(voter_df.____.desc()).show(____)
____.orderBy(____).show(10)
Редактировать и запускать код