การแปลงข้อมูลสุนัข
หลังจากที่ได้ทำความสะอาดชุดข้อมูลเบื้องต้นไปพอสมควรแล้ว ขั้นตอนต่อไปคือการวิเคราะห์ข้อมูลให้ลึกขึ้น มีคำถามหลายข้อเกี่ยวกับประเภทของสุนัขที่ปรากฏในรูปภาพ รวมถึงรายละเอียดต่าง ๆ ของรูปภาพเหล่านั้น เพื่อตอบคำถามเหล่านี้ได้ จำเป็นต้องแปลงข้อมูลให้อยู่ในรูปแบบที่กำหนด ก่อนจะนำไปใช้งานได้ ต้องสร้าง schema หรือ type สำหรับแทนรายละเอียดของสุนัขก่อน
DataFrame joined_df ยังคงสถานะตามที่กำหนดไว้ครั้งล่าสุด และได้ import pyspark.sql.types ทั้งหมดเรียบร้อยแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การทำความสะอาดข้อมูลด้วย PySpark
คำแนะนำการฝึกหัด
- เลือกคอลัมน์ที่แสดงรายละเอียดของสุนัขจาก DataFrame แล้วแสดง 10 แถวแรกโดยไม่ตัดข้อความ
- สร้าง schema ใหม่ตามแนวทางที่ทำมาก่อนหน้านี้ โดยใช้ breed, start_x, start_y, end_x และ end_y เป็นชื่อฟิลด์ พร้อมระบุประเภทข้อมูลที่ถูกต้องให้แต่ละฟิลด์ (ค่าตัวเลขทั้งหมดเป็น integer)
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Select the dog details and show 10 untruncated rows
print(joined_df.____.show(____, truncate=____))
# Define a schema type for the details in the dog list
DogType = ____([
StructField("breed", ____, False),
StructField("start_x", ____, False),
____,
____,
____
])