Анализ некорректных строк
Вы успешно отфильтровали строки с помощью объединения, однако иногда полезно изучить именно некорректные данные. Их можно сохранить для дальнейшей обработки или для отладки источников данных.
Ваша задача — найти разницу между двумя DataFrame и сохранить некорректные строки.
Объект spark определён, а функции pyspark.sql.functions импортированы как F. Исходный DataFrame split_df и объединённый DataFrame joined_df доступны в том состоянии, в котором они находились ранее.
Это упражнение является частью курса
Очистка данных с помощью PySpark
Инструкции к упражнению
- Определите количество строк в каждом DataFrame.
- Создайте DataFrame, содержащий только некорректные строки.
- Убедитесь, что количество строк в новом DataFrame соответствует ожидаемому.
- Определите количество уникальных удалённых строк с папками.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Determine the row counts for each DataFrame
split_count = ____
joined_count = ____
# Create a DataFrame containing the invalid rows
invalid_df = split_df.____(____(joined_df), '____', '____')
# Validate the count of the new DataFrame is as expected
invalid_count = ____
print(" split_df:\t%d\n joined_df:\t%d\n invalid_df: \t%d" % (split_count, joined_count, invalid_count))
# Determine the number of distinct folder rows removed
invalid_folder_count = invalid_df.____('____').____.____
print("%d distinct invalid folders found" % invalid_folder_count)