Zacznij terazZacznij za darmo

Parsowanie danych o psach

Udało ci się wyczyścić sporo danych w początkowym zbiorze – teraz czas przeanalizować je głębiej. Pojawiło się kilka pytań dotyczących ras psów widocznych na zdjęciach oraz szczegółów samych obrazów. Żeby na nie odpowiedzieć, musisz przetworzyć dane do określonego formatu. Zanim to zrobisz, utwórz schemat reprezentujący szczegóły dotyczące psów.

DataFrame joined_df jest taki, jakim go ostatnio zdefiniowano, a wszystkie typy z pyspark.sql.types zostały już zaimportowane.

To ćwiczenie jest częścią kursu

Czyszczenie danych w PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Wybierz kolumnę reprezentującą szczegóły o psach z DataFrame i wyświetl pierwsze 10 wierszy bez obcinania treści.
  • Utwórz nowy schemat, tak jak robiłeś to wcześniej, używając nazw breed, start_x, start_y, end_x i end_y. Pamiętaj, aby dla każdego pola określić właściwy typ danych (wszystkie wartości liczbowe są liczbami całkowitymi).

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Select the dog details and show 10 untruncated rows
print(joined_df.____.show(____, truncate=____))

# Define a schema type for the details in the dog list
DogType = ____([
	StructField("breed", ____, False),
    StructField("start_x", ____, False),
    ____,
    ____,
    ____
])
Edytuj i uruchom kod