Проверка строк с помощью объединения
Ещё один способ фильтрации данных — использование объединений для удаления недопустимых записей. Вам нужно проверить, соответствуют ли названия папок ожидаемым значениям на основе DataFrame valid_folders_df. DataFrame split_df находится в том же состоянии, в котором вы его оставили: с набором разделённых столбцов.
Объект spark доступен, а pyspark.sql.functions импортирован как F.
Это упражнение является частью курса
Очистка данных с помощью PySpark
Инструкции к упражнению
- Переименуйте столбец
_c0вfolderв DataFramevalid_folders_df. - Подсчитайте количество строк в
split_df. - Объедините два DataFrame по названию папки и сохраните результат в
joined_df. Обязательно примените broadcast к меньшему DataFrame. - Проверьте количество оставшихся строк в DataFrame и сравните результаты.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Rename the column in valid_folders_df
valid_folders_df = ____
# Count the number of rows in split_df
split_count = ____
# Join the DataFrames
joined_df = split_df.____(____(valid_folders_df), "folder")
# Compare the number of rows remaining
joined_count = ____
print("Before: %d\nAfter: %d" % (split_count, joined_count))