Parsowanie danych o psach
Udało ci się wyczyścić sporo danych w początkowym zbiorze – teraz czas przeanalizować je głębiej. Pojawiło się kilka pytań dotyczących ras psów widocznych na zdjęciach oraz szczegółów samych obrazów. Żeby na nie odpowiedzieć, musisz przetworzyć dane do określonego formatu. Zanim to zrobisz, utwórz schemat reprezentujący szczegóły dotyczące psów.
DataFrame joined_df jest taki, jakim go ostatnio zdefiniowano, a wszystkie typy z pyspark.sql.types zostały już zaimportowane.
To ćwiczenie jest częścią kursu
Czyszczenie danych w PySpark
Instrukcje do ćwiczenia
- Wybierz kolumnę reprezentującą szczegóły o psach z DataFrame i wyświetl pierwsze 10 wierszy bez obcinania treści.
- Utwórz nowy schemat, tak jak robiłeś to wcześniej, używając nazw breed, start_x, start_y, end_x i end_y. Pamiętaj, aby dla każdego pola określić właściwy typ danych (wszystkie wartości liczbowe są liczbami całkowitymi).
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Select the dog details and show 10 untruncated rows
print(joined_df.____.show(____, truncate=____))
# Define a schema type for the details in the dog list
DogType = ____([
StructField("breed", ____, False),
StructField("start_x", ____, False),
____,
____,
____
])