Перевірка рядків через join
Ще один спосіб фільтрації даних — використати join, щоб прибрати некоректні записи. Вам потрібно перевірити, що назви тек відповідають очікуваним на основі переданого датафрейму valid_folders_df. Датафрейм split_df — у тому стані, в якому ви його лишили, з групою розділених стовпців.
Обʼєкт spark доступний, а pyspark.sql.functions імпортовано як F.
Ця вправа є частиною курсу
Очищення даних у PySpark
Інструкції до вправи
- Перейменуйте стовпець
_c0наfolderу датафрейміvalid_folders_df. - Порахуйте кількість рядків у
split_df. - Обʼєднайте два датафрейми за назвою теки та назвіть отриманий датафрейм
joined_df. Обовʼязково зробіть broadcast для меншого датафрейму. - Перевірте, скільки рядків залишилося в датафреймі, і порівняйте результат.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Rename the column in valid_folders_df
valid_folders_df = ____
# Count the number of rows in split_df
split_count = ____
# Join the DataFrames
joined_df = split_df.____(____(valid_folders_df), "folder")
# Compare the number of rows remaining
joined_count = ____
print("Before: %d\nAfter: %d" % (split_count, joined_count))