Перевірка некоректних рядків
Ви успішно відфільтрували рядки за допомогою об'єднання, але інколи потрібно переглянути дані, які є некоректними. Такі дані можна зберегти для подальшої обробки або для діагностики джерел даних.
Вам потрібно знайти різницю між двома датафреймами та зберегти некоректні рядки.
Об'єкт spark визначено, а pyspark.sql.functions імпортовано як F. Початковий датафрейм split_df і об'єднаний датафрейм joined_df доступні у своїх попередніх станах.
Ця вправа є частиною курсу
Очищення даних у PySpark
Інструкції до вправи
- Визначте кількість рядків для кожного датафрейму.
- Створіть датафрейм, що міститиме лише некоректні рядки.
- Переконайтеся, що кількість рядків у новому датафреймі відповідає очікуванню.
- Визначте кількість унікальних рядків із папками, які було вилучено.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Determine the row counts for each DataFrame
split_count = ____
joined_count = ____
# Create a DataFrame containing the invalid rows
invalid_df = split_df.____(____(joined_df), '____', '____')
# Validate the count of the new DataFrame is as expected
invalid_count = ____
print(" split_df:\t%d\n joined_df:\t%d\n invalid_df: \t%d" % (split_count, joined_count, invalid_count))
# Determine the number of distinct folder rows removed
invalid_folder_count = invalid_df.____('____').____.____
print("%d distinct invalid folders found" % invalid_folder_count)