Parsarea datelor despre câini
Ai efectuat numeroase operațiuni de curățare asupra setului de date inițial, dar acum trebuie să analizezi datele mai în profunzime. Au apărut câteva întrebări despre tipul de câini identificați într-o imagine și despre detaliile imaginilor respective. Îți dai seama că, pentru a răspunde la aceste întrebări, trebuie să procesezi datele într-un anumit format. Înainte de a le putea folosi, va trebui să creezi o schemă / un tip care să reprezinte detaliile despre câini.
DataFrame-ul joined_df este cel definit anterior, iar tipurile din pyspark.sql.types au fost deja importate.
Acest exercițiu face parte din cursul
Curățarea datelor cu PySpark
Instrucțiuni pentru exercițiu
- Selectează coloana care reprezintă detaliile despre câini din DataFrame și afișează primele 10 rânduri fără trunchiere.
- Creează o nouă schemă, așa cum ai mai făcut anterior, folosind breed, start_x, start_y, end_x și end_y ca nume de câmpuri. Asigură-te că specifici tipurile de date corecte pentru fiecare câmp din schemă (orice valoare numerică este un număr întreg).
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Select the dog details and show 10 untruncated rows
print(joined_df.____.show(____, truncate=____))
# Define a schema type for the details in the dog list
DogType = ____([
StructField("breed", ____, False),
StructField("start_x", ____, False),
____,
____,
____
])