1. Learn
  2. /
  3. Курси
  4. /
  5. Опрацювання ознак у PySpark

Connected

Вправа

Перевірка некоректних зʼєднань

Зʼєднання можуть «ламатися» непомітно, якщо не бути уважними: замість помилки ви отримаєте спотворені дані — більше або менше записів, ніж очікували. Розгляньмо кілька способів, як неправильне зʼєднання може погіршити ваш набір даних.

У цьому прикладі ми подивимося, що станеться, якщо зʼєднати два датафрейми, коли ключі зʼєднання мають різну точність, і порівняємо кількість записів між правильним і неправильним зʼєднанням.

Інструкції

100 XP
  • Створіть зʼєднання між df_orig — датафреймом до виправлення точності — та walk_df, що зіставляє longitude і latitude у відповідних датафреймах.
  • Порахуйте кількість пропущених значень за допомогою where() і isNull() для df['walkscore'] і correct_join['walkscore']. Ви маєте помітити багато пропусків, адже типи даних і точність не збігаються.
  • Створіть зʼєднання між df і walk_df, яке зіставляє лише longitude.
  • Порахуйте кількість записів за допомогою count() для few_keys_df і correct_join_df. Ви маєте побачити значно більше значень, оскільки ми некоректно обмежили умови зіставлення.