कॉलम में स्प्लिट करना
आपने DataFrame से अमान्य पंक्तियाँ हटाकर अपने डेटा को काफी हद तक क्लीन कर लिया है. अब आप DataFrame की सामग्री के आधार पर कुछ अर्थपूर्ण कॉलम बनाकर आगे के ट्रांसफॉर्मेशन करना चाहते हैं.
आपके पास spark कॉन्टेक्स्ट और annotations_df DataFrame का नवीनतम वर्शन है. pyspark.sql.functions उपनाम F के रूप में उपलब्ध है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ डेटा क्लीनिंग
अभ्यास निर्देश
'_c0'कॉलम की सामग्री को tab करैक्टर पर स्प्लिट कीजिए औरsplit_colsनाम के वैरिएबल में स्टोर कीजिए.- ऊपर वाले वैरिएबल की शुरुआती चार एंट्री के आधार पर ये कॉलम जोड़िए: folder, filename, width, height, एक DataFrame जिसका नाम
split_dfहै, पर. split_colsवैरिएबल को एक कॉलम के तौर पर जोड़ दीजिए.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Split the content of _c0 on the tab character (aka, '\t')
split_cols = ____(annotations_df['____'], '\t')
# Add the columns folder, filename, width, and height
split_df = annotations_df.withColumn('folder', split_cols.getItem(____))
split_df = split_df.withColumn('filename', ____
split_df = split_df.____
____
# Add split_cols as a column
split_df = split_df.____