ПочатиПочніть безкоштовно

Перевірка рядків через join

Ще один спосіб фільтрації даних — використати join, щоб прибрати некоректні записи. Вам потрібно перевірити, що назви тек відповідають очікуваним на основі переданого датафрейму valid_folders_df. Датафрейм split_df — у тому стані, в якому ви його лишили, з групою розділених стовпців.

Обʼєкт spark доступний, а pyspark.sql.functions імпортовано як F.

Ця вправа є частиною курсу

Очищення даних у PySpark

Переглянути курс

Інструкції до вправи

  • Перейменуйте стовпець _c0 на folder у датафреймі valid_folders_df.
  • Порахуйте кількість рядків у split_df.
  • Обʼєднайте два датафрейми за назвою теки та назвіть отриманий датафрейм joined_df. Обовʼязково зробіть broadcast для меншого датафрейму.
  • Перевірте, скільки рядків залишилося в датафреймі, і порівняйте результат.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Rename the column in valid_folders_df
valid_folders_df = ____

# Count the number of rows in split_df
split_count = ____

# Join the DataFrames
joined_df = split_df.____(____(valid_folders_df), "folder")

# Compare the number of rows remaining
joined_count = ____
print("Before: %d\nAfter: %d" % (split_count, joined_count))
Редагувати та запускати код