Inizia subitoInizia gratis

Parsing dei cani

Hai già svolto una notevole pulizia sul dataset iniziale, ma ora devi analizzare i dati più in profondità. Sono emerse diverse domande sul tipo di cani presenti in un'immagine e su alcuni dettagli delle immagini. Ti rendi conto che, per rispondere a queste domande, devi trasformare i dati in un tipo specifico. Prima di poterlo usare, dovrai creare uno schema/tipo per rappresentare i dettagli del cane.

Il DataFrame joined_df è definito come in precedenza e i moduli pyspark.sql.types sono già stati importati.

Questo esercizio fa parte del corso

Pulizia dei dati con PySpark

Visualizza corso

Istruzioni dell'esercizio

  • Seleziona dal DataFrame la colonna che rappresenta i dettagli del cane e mostra le prime 10 righe non troncate.
  • Crea un nuovo schema come hai fatto in precedenza, usando breed, start_x, start_y, end_x ed end_y come nomi. Assicurati di specificare i tipi di dato corretti per ogni campo nello schema (ogni valore numerico è un intero).

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Select the dog details and show 10 untruncated rows
print(joined_df.____.show(____, truncate=____))

# Define a schema type for the details in the dog list
DogType = ____([
	StructField("breed", ____, False),
    StructField("start_x", ____, False),
    ____,
    ____,
    ____
])
Modifica ed esegui il codice