Parsning av hundar
Du har gjort en hel del städning av det ursprungliga datasetet, men behöver nu analysera datan lite djupare. Det har dykt upp flera frågor om vilken typ av hundar som syns i en bild och vissa detaljer om bilderna. För att kunna besvara dessa frågor behöver du bearbeta datan till ett specifikt format. Innan du kan använda den behöver du skapa ett schema för att representera hunddetaljerna.
DataFrame:en joined_df är definierad som tidigare och alla typer från pyspark.sql.types har importerats.
Den här övningen är en del av kursen
Datarensning med PySpark
Övningsinstruktioner
- Välj den kolumn som representerar hunddetaljerna från DataFrame:en och visa de första 10 raderna utan trunkering.
- Skapa ett nytt schema på samma sätt som tidigare, med breed, start_x, start_y, end_x och end_y som namn. Se till att ange rätt datatyper för varje fält i schemat (alla numeriska värden är heltal).
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Select the dog details and show 10 untruncated rows
print(joined_df.____.show(____, truncate=____))
# Define a schema type for the details in the dog list
DogType = ____([
StructField("breed", ____, False),
StructField("start_x", ____, False),
____,
____,
____
])