Kom igångKom igång gratis

Parsning av hundar

Du har gjort en hel del städning av det ursprungliga datasetet, men behöver nu analysera datan lite djupare. Det har dykt upp flera frågor om vilken typ av hundar som syns i en bild och vissa detaljer om bilderna. För att kunna besvara dessa frågor behöver du bearbeta datan till ett specifikt format. Innan du kan använda den behöver du skapa ett schema för att representera hunddetaljerna.

DataFrame:en joined_df är definierad som tidigare och alla typer från pyspark.sql.types har importerats.

Den här övningen är en del av kursen

Datarensning med PySpark

Visa kurs

Övningsinstruktioner

  • Välj den kolumn som representerar hunddetaljerna från DataFrame:en och visa de första 10 raderna utan trunkering.
  • Skapa ett nytt schema på samma sätt som tidigare, med breed, start_x, start_y, end_x och end_y som namn. Se till att ange rätt datatyper för varje fält i schemat (alla numeriska värden är heltal).

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Select the dog details and show 10 untruncated rows
print(joined_df.____.show(____, truncate=____))

# Define a schema type for the details in the dog list
DogType = ____([
	StructField("breed", ____, False),
    StructField("start_x", ____, False),
    ____,
    ____,
    ____
])
Redigera och kör kod