Фільтрування вмісту стовпця в Python
Ви вже попрацювали з різними операціями над стовпцями датафрейма — тепер час змінити реальний набір даних. Датафрейм voter_df містить інформацію про голосування в міській раді Далласа за останні кілька років. Цей скорочений датафрейм містить дату голосування, а також ім'я та посаду того, хто голосував. Ваш(а) керівник(иня) попросив(ла) вас очистити ці дані, щоб їх можна було згодом інтегрувати в потрібні звіти. Основне завдання — прибрати всі значення null або дивні символи та повернути конкретний набір виборців, для яких ви зможете перевірити інформацію.
Це часто один із перших кроків очищення даних — прибрати все, що явно не відповідає формату. Для цього набору даних обов'язково перегляньте вихідні значення та зверніть увагу на те, що виглядає нетипово у стовпці VOTER_NAME.
Бібліотеку pyspark.sql.functions уже імпортовано з псевдонімом F.
Ця вправа є частиною курсу
Очищення даних у PySpark
Інструкції до вправи
- Показати унікальні значення
VOTER_NAME. - Відфільтрувати
voter_df, де довжинаVOTER_NAME— від 1 до 20 символів. - Відфільтрувати записи
voter_df, деVOTER_NAMEмістить_. - Знову показати унікальні значення
VOTER_NAME.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Show the distinct VOTER_NAME entries
voter_df.select(____).distinct().show(40, truncate=False)
# Filter voter_df where the VOTER_NAME is 1-20 characters in length
voter_df = ____('length(VOTER_NAME) > 0 and length(VOTER_NAME) < 20')
# Filter out voter_df where the VOTER_NAME contains an underscore
voter_df = voter_df.filter(~ F.col('VOTER_NAME').____)
# Show the distinct VOTER_NAME entries again
voter_df.____(____).____().____(40, truncate=False)