เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

จำนวนต่อภาพ

ขั้นตอนต่อไปในการสร้าง data pipeline สำหรับชุดข้อมูลนี้คือการสร้างคอลัมน์สำหรับการวิเคราะห์ โดยต้องคำนวณจำนวนสุนัขที่พบในแต่ละภาพจากคอลัมน์ dog_list ที่สร้างไว้ก่อนหน้า นอกจากนี้ยังได้สร้าง DogType ไว้เพื่อช่วยให้แยกวิเคราะห์ข้อมูลในคอลัมน์ต่าง ๆ ได้ดียิ่งขึ้น

joined_df พร้อมใช้งานตามที่กำหนดไว้ล่าสุด และ DogType StructType ถูกกำหนดไว้แล้ว pyspark.sql.functions พร้อมใช้งานภายใต้ alias F

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การทำความสะอาดข้อมูลด้วย PySpark

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้างฟังก์ชัน Python เพื่อแยกแต่ละรายการใน dog_list ออกเป็นส่วนต่าง ๆ ที่เหมาะสม อย่าลืมแปลงค่าที่เป็น string ให้เป็นประเภทข้อมูลที่ถูกต้อง มิฉะนั้น DogType จะไม่สามารถแยกวิเคราะห์ข้อมูลได้
  • สร้าง UDF โดยใช้ฟังก์ชันที่สร้างขึ้นข้างต้น
  • ใช้ UDF เพื่อสร้างคอลัมน์ใหม่ชื่อ dogs
  • แสดงจำนวนสุนัขในคอลัมน์ใหม่สำหรับ 10 แถวแรก

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create a function to return the number and type of dogs as a tuple
def dogParse(doglist):
  dogs = []
  for dog in doglist:
    (breed, start_x, start_y, end_x, end_y) = dog.____('____')
    dogs.append((____, int(____), ____, ____, ____))
  return dogs

# Create a UDF
udfDogParse = ____(____, ArrayType(____))

# Use the UDF to list of dogs
joined_df = joined_df.____('____', ____('____'))

# Show the number of dogs in the first 10 rows
joined_df.____(____('____')).____(____)
แก้ไขและรันโค้ด