เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การแบ่งข้อมูลออกเป็นคอลัมน์

ตอนนี้คุณได้ทำความสะอาดข้อมูลไปมากพอสมควรแล้ว ด้วยการลบแถวที่ไม่ถูกต้องออกจาก DataFrame ขั้นต่อไปคือการแปลงข้อมูลเพิ่มเติม โดยสร้างคอลัมน์ที่มีความหมายเฉพาะจากเนื้อหาใน DataFrame

คุณมี spark context และ annotations_df DataFrame เวอร์ชันล่าสุดพร้อมใช้งาน โดย pyspark.sql.functions ถูก import ภายใต้ชื่อย่อ F

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การทำความสะอาดข้อมูลด้วย PySpark

ดูคอร์ส

คำแนะนำการฝึกหัด

  • แบ่งเนื้อหาในคอลัมน์ '_c0' โดยใช้อักขระ tab แล้วเก็บผลลัพธ์ไว้ในตัวแปรชื่อ split_cols
  • เพิ่มคอลัมน์ต่อไปนี้โดยอ้างอิงจาก 4 รายการแรกในตัวแปรข้างต้น ได้แก่ folder, filename, width, height ลงใน DataFrame ชื่อ split_df
  • เพิ่มตัวแปร split_cols เป็นคอลัมน์หนึ่งใน DataFrame

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Split the content of _c0 on the tab character (aka, '\t')
split_cols = ____(annotations_df['____'], '\t')

# Add the columns folder, filename, width, and height
split_df = annotations_df.withColumn('folder', split_cols.getItem(____))
split_df = split_df.withColumn('filename', ____
split_df = split_df.____
____

# Add split_cols as a column
split_df = split_df.____
แก้ไขและรันโค้ด