開始使用免費開始

狗狗解析

你已經對最初的資料集做了相當多的清理,但現在需要更深入分析。關於影像中辨識到的狗的種類,以及影像本身的一些細節,出現了幾個新問題。你發現要回答這些問題,必須先把資料轉換成特定的型別。在能使用之前,你需要建立一個 schema/型別來表示狗的細節。

joined_df DataFrame 與你上一個步驟定義的一樣,而 pyspark.sql.types 都已經匯入。

本練習屬於課程

使用 PySpark 清理資料

檢視課程

練習說明

  • 從 DataFrame 中選取代表狗狗細節的欄位,並顯示前 10 列且不要截斷內容。
  • 如同先前做過的,建立一個新的 schema,名稱使用 breedstart_xstart_yend_xend_y。請為 schema 中每個欄位指定正確的資料型別(任何數值欄位都是整數)。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Select the dog details and show 10 untruncated rows
print(joined_df.____.show(____, truncate=____))

# Define a schema type for the details in the dog list
DogType = ____([
	StructField("breed", ____, False),
    StructField("start_x", ____, False),
    ____,
    ____,
    ____
])
編輯並執行程式碼