狗狗解析
你已經對最初的資料集做了相當多的清理,但現在需要更深入分析。關於影像中辨識到的狗的種類,以及影像本身的一些細節,出現了幾個新問題。你發現要回答這些問題,必須先把資料轉換成特定的型別。在能使用之前,你需要建立一個 schema/型別來表示狗的細節。
joined_df DataFrame 與你上一個步驟定義的一樣,而 pyspark.sql.types 都已經匯入。
本練習屬於課程
使用 PySpark 清理資料
練習說明
- 從 DataFrame 中選取代表狗狗細節的欄位,並顯示前 10 列且不要截斷內容。
- 如同先前做過的,建立一個新的 schema,名稱使用 breed、start_x、start_y、end_x、end_y。請為 schema 中每個欄位指定正確的資料型別(任何數值欄位都是整數)。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Select the dog details and show 10 untruncated rows
print(joined_df.____.show(____, truncate=____))
# Define a schema type for the details in the dog list
DogType = ____([
StructField("breed", ____, False),
StructField("start_x", ____, False),
____,
____,
____
])