ПочатиПочніть безкоштовно

Фільтрування вмісту стовпця в Python

Ви вже попрацювали з різними операціями над стовпцями датафрейма — тепер час змінити реальний набір даних. Датафрейм voter_df містить інформацію про голосування в міській раді Далласа за останні кілька років. Цей скорочений датафрейм містить дату голосування, а також ім'я та посаду того, хто голосував. Ваш(а) керівник(иня) попросив(ла) вас очистити ці дані, щоб їх можна було згодом інтегрувати в потрібні звіти. Основне завдання — прибрати всі значення null або дивні символи та повернути конкретний набір виборців, для яких ви зможете перевірити інформацію.

Це часто один із перших кроків очищення даних — прибрати все, що явно не відповідає формату. Для цього набору даних обов'язково перегляньте вихідні значення та зверніть увагу на те, що виглядає нетипово у стовпці VOTER_NAME.

Бібліотеку pyspark.sql.functions уже імпортовано з псевдонімом F.

Ця вправа є частиною курсу

Очищення даних у PySpark

Переглянути курс

Інструкції до вправи

  • Показати унікальні значення VOTER_NAME.
  • Відфільтрувати voter_df, де довжина VOTER_NAME — від 1 до 20 символів.
  • Відфільтрувати записи voter_df, де VOTER_NAME містить _.
  • Знову показати унікальні значення VOTER_NAME.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Show the distinct VOTER_NAME entries
voter_df.select(____).distinct().show(40, truncate=False)

# Filter voter_df where the VOTER_NAME is 1-20 characters in length
voter_df = ____('length(VOTER_NAME) > 0 and length(VOTER_NAME) < 20')

# Filter out voter_df where the VOTER_NAME contains an underscore
voter_df = voter_df.filter(~ F.col('VOTER_NAME').____)

# Show the distinct VOTER_NAME entries again
voter_df.____(____).____().____(40, truncate=False)
Редагувати та запускати код