Розбір даних про собак
Ви вже суттєво почистили початковий набір даних, але тепер потрібно проаналізувати його глибше. З'явилося кілька запитань щодо типів собак на зображенні та деяких деталей самих зображень. Ви розумієте, що для відповіді на ці запитання потрібно обробити дані до конкретного типу. Перш ніж ви зможете його використовувати, потрібно створити схему/тип для представлення деталей про собаку.
Датaфрейм joined_df — у тому стані, в якому ви його залишили, а модулі з pyspark.sql.types уже імпортовано.
Ця вправа є частиною курсу
Очищення даних у PySpark
Інструкції до вправи
- Виберіть зі датафрейму стовпець із деталями про собаку та виведіть перші 10 рядків без скорочення.
- Створіть нову схему, як ви робили раніше, використавши назви breed, start_x, start_y, end_x і end_y. Обов'язково вкажіть відповідні типи даних для кожного поля в схемі (будь-які числові значення — це цілі числа).
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Select the dog details and show 10 untruncated rows
print(joined_df.____.show(____, truncate=____))
# Define a schema type for the details in the dog list
DogType = ____([
StructField("breed", ____, False),
StructField("start_x", ____, False),
____,
____,
____
])