НачатьНачать бесплатно

Анализ некорректных строк

Вы успешно отфильтровали строки с помощью объединения, однако иногда полезно изучить именно некорректные данные. Их можно сохранить для дальнейшей обработки или для отладки источников данных.

Ваша задача — найти разницу между двумя DataFrame и сохранить некорректные строки.

Объект spark определён, а функции pyspark.sql.functions импортированы как F. Исходный DataFrame split_df и объединённый DataFrame joined_df доступны в том состоянии, в котором они находились ранее.

Это упражнение является частью курса

Очистка данных с помощью PySpark

Посмотреть курс

Инструкции к упражнению

  • Определите количество строк в каждом DataFrame.
  • Создайте DataFrame, содержащий только некорректные строки.
  • Убедитесь, что количество строк в новом DataFrame соответствует ожидаемому.
  • Определите количество уникальных удалённых строк с папками.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Determine the row counts for each DataFrame
split_count = ____
joined_count = ____

# Create a DataFrame containing the invalid rows
invalid_df = split_df.____(____(joined_df), '____', '____')

# Validate the count of the new DataFrame is as expected
invalid_count = ____
print(" split_df:\t%d\n joined_df:\t%d\n invalid_df: \t%d" % (split_count, joined_count, invalid_count))

# Determine the number of distinct folder rows removed
invalid_folder_count = invalid_df.____('____').____.____
print("%d distinct invalid folders found" % invalid_folder_count)
Редактировать и запускать код