การแบ่งข้อมูลออกเป็นคอลัมน์
ตอนนี้คุณได้ทำความสะอาดข้อมูลไปมากพอสมควรแล้ว ด้วยการลบแถวที่ไม่ถูกต้องออกจาก DataFrame ขั้นต่อไปคือการแปลงข้อมูลเพิ่มเติม โดยสร้างคอลัมน์ที่มีความหมายเฉพาะจากเนื้อหาใน DataFrame
คุณมี spark context และ annotations_df DataFrame เวอร์ชันล่าสุดพร้อมใช้งาน โดย pyspark.sql.functions ถูก import ภายใต้ชื่อย่อ F
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การทำความสะอาดข้อมูลด้วย PySpark
คำแนะนำการฝึกหัด
- แบ่งเนื้อหาในคอลัมน์
'_c0'โดยใช้อักขระ tab แล้วเก็บผลลัพธ์ไว้ในตัวแปรชื่อsplit_cols - เพิ่มคอลัมน์ต่อไปนี้โดยอ้างอิงจาก 4 รายการแรกในตัวแปรข้างต้น ได้แก่ folder, filename, width, height ลงใน DataFrame ชื่อ
split_df - เพิ่มตัวแปร
split_colsเป็นคอลัมน์หนึ่งใน DataFrame
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Split the content of _c0 on the tab character (aka, '\t')
split_cols = ____(annotations_df['____'], '\t')
# Add the columns folder, filename, width, and height
split_df = annotations_df.withColumn('folder', split_cols.getItem(____))
split_df = split_df.withColumn('filename', ____
split_df = split_df.____
____
# Add split_cols as a column
split_df = split_df.____