ПочатиПочніть безкоштовно

Перевірка некоректних рядків

Ви успішно відфільтрували рядки за допомогою об'єднання, але інколи потрібно переглянути дані, які є некоректними. Такі дані можна зберегти для подальшої обробки або для діагностики джерел даних.

Вам потрібно знайти різницю між двома датафреймами та зберегти некоректні рядки.

Об'єкт spark визначено, а pyspark.sql.functions імпортовано як F. Початковий датафрейм split_df і об'єднаний датафрейм joined_df доступні у своїх попередніх станах.

Ця вправа є частиною курсу

Очищення даних у PySpark

Переглянути курс

Інструкції до вправи

  • Визначте кількість рядків для кожного датафрейму.
  • Створіть датафрейм, що міститиме лише некоректні рядки.
  • Переконайтеся, що кількість рядків у новому датафреймі відповідає очікуванню.
  • Визначте кількість унікальних рядків із папками, які було вилучено.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Determine the row counts for each DataFrame
split_count = ____
joined_count = ____

# Create a DataFrame containing the invalid rows
invalid_df = split_df.____(____(joined_df), '____', '____')

# Validate the count of the new DataFrame is as expected
invalid_count = ____
print(" split_df:\t%d\n joined_df:\t%d\n invalid_df: \t%d" % (split_count, joined_count, invalid_count))

# Determine the number of distinct folder rows removed
invalid_folder_count = invalid_df.____('____').____.____
print("%d distinct invalid folders found" % invalid_folder_count)
Редагувати та запускати код