НачатьНачать бесплатно

Проверка строк с помощью объединения

Ещё один способ фильтрации данных — использование объединений для удаления недопустимых записей. Вам нужно проверить, соответствуют ли названия папок ожидаемым значениям на основе DataFrame valid_folders_df. DataFrame split_df находится в том же состоянии, в котором вы его оставили: с набором разделённых столбцов.

Объект spark доступен, а pyspark.sql.functions импортирован как F.

Это упражнение является частью курса

Очистка данных с помощью PySpark

Посмотреть курс

Инструкции к упражнению

  • Переименуйте столбец _c0 в folder в DataFrame valid_folders_df.
  • Подсчитайте количество строк в split_df.
  • Объедините два DataFrame по названию папки и сохраните результат в joined_df. Обязательно примените broadcast к меньшему DataFrame.
  • Проверьте количество оставшихся строк в DataFrame и сравните результаты.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Rename the column in valid_folders_df
valid_folders_df = ____

# Count the number of rows in split_df
split_count = ____

# Join the DataFrames
joined_df = split_df.____(____(valid_folders_df), "folder")

# Compare the number of rows remaining
joined_count = ____
print("Before: %d\nAfter: %d" % (split_count, joined_count))
Редактировать и запускать код