Začněte nyníZačněte zdarma

Parsování dat o psech

Počáteční datovou sadu jsi už pěkně pročistil/a, ale teď je potřeba data trochu hlouběji analyzovat. Objevilo se několik otázek týkajících se druhu psů na obrázcích i dalších detailů k nim. Aby bylo možné na tyto otázky odpovědět, je nutné data převést do konkrétního datového typu. Nejdřív ale musíš vytvořit schéma, které bude reprezentovat informace o psech.

DataFrame joined_df je ve stavu, v jakém jsi ho naposledy definoval/a, a vše z pyspark.sql.types je již naimportováno.

Toto cvičení je součástí kurzu

Cleaning Data with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Vyber sloupec s detaily o psech z DataFramu a zobraz prvních 10 řádků bez zkrácení.
  • Vytvoř nové schéma stejným způsobem jako dříve, s názvy polí breed, start_x, start_y, end_x a end_y. Nezapomeň každému poli přiřadit správný datový typ (všechny číselné hodnoty jsou celá čísla).

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Select the dog details and show 10 untruncated rows
print(joined_df.____.show(____, truncate=____))

# Define a schema type for the details in the dog list
DogType = ____([
	StructField("breed", ____, False),
    StructField("start_x", ____, False),
    ____,
    ____,
    ____
])
Upravit a spustit kód