Parsování dat o psech
Počáteční datovou sadu jsi už pěkně pročistil/a, ale teď je potřeba data trochu hlouběji analyzovat. Objevilo se několik otázek týkajících se druhu psů na obrázcích i dalších detailů k nim. Aby bylo možné na tyto otázky odpovědět, je nutné data převést do konkrétního datového typu. Nejdřív ale musíš vytvořit schéma, které bude reprezentovat informace o psech.
DataFrame joined_df je ve stavu, v jakém jsi ho naposledy definoval/a, a vše z pyspark.sql.types je již naimportováno.
Toto cvičení je součástí kurzu
Cleaning Data with PySpark
Pokyny k cvičení
- Vyber sloupec s detaily o psech z DataFramu a zobraz prvních 10 řádků bez zkrácení.
- Vytvoř nové schéma stejným způsobem jako dříve, s názvy polí breed, start_x, start_y, end_x a end_y. Nezapomeň každému poli přiřadit správný datový typ (všechny číselné hodnoty jsou celá čísla).
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Select the dog details and show 10 untruncated rows
print(joined_df.____.show(____, truncate=____))
# Define a schema type for the details in the dog list
DogType = ____([
StructField("breed", ____, False),
StructField("start_x", ____, False),
____,
____,
____
])