Parsing dei cani
Hai già svolto una notevole pulizia sul dataset iniziale, ma ora devi analizzare i dati più in profondità. Sono emerse diverse domande sul tipo di cani presenti in un'immagine e su alcuni dettagli delle immagini. Ti rendi conto che, per rispondere a queste domande, devi trasformare i dati in un tipo specifico. Prima di poterlo usare, dovrai creare uno schema/tipo per rappresentare i dettagli del cane.
Il DataFrame joined_df è definito come in precedenza e i moduli pyspark.sql.types sono già stati importati.
Questo esercizio fa parte del corso
Pulizia dei dati con PySpark
Istruzioni dell'esercizio
- Seleziona dal DataFrame la colonna che rappresenta i dettagli del cane e mostra le prime 10 righe non troncate.
- Crea un nuovo schema come hai fatto in precedenza, usando breed, start_x, start_y, end_x ed end_y come nomi. Assicurati di specificare i tipi di dato corretti per ogni campo nello schema (ogni valore numerico è un intero).
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Select the dog details and show 10 untruncated rows
print(joined_df.____.show(____, truncate=____))
# Define a schema type for the details in the dog list
DogType = ____([
StructField("breed", ____, False),
StructField("start_x", ____, False),
____,
____,
____
])