शुरू करेंमुफ़्त में शुरू करें

अमान्य पंक्तियाँ हटाना

अब जब आपने सफलतापूर्वक कमेंट की गई पंक्तियाँ हटा दी हैं, तो आपको डेटा के सामान्य फ़ॉर्मेट के बारे में कुछ जानकारी मिली है। DataFrame में कम से कम 5 टैब-सेपरेटेड कॉलम होने चाहिए। याद रखें कि आपका मूल DataFrame केवल एक ही कॉलम वाला है, इसलिए आपको टैब (\t) कैरेक्टर्स पर डेटा को स्प्लिट करना होगा.

DataFrame annotations_df पहले से उपलब्ध है, जिसमें कमेंट की गई पंक्तियाँ हटा दी गई हैं। spark.sql.functions लाइब्रेरी F उपनाम के रूप में उपलब्ध है। DataFrame में उपलब्ध पंक्तियों की आरंभिक संख्या वैरिएबल initial_count में स्टोर है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ डेटा क्लीनिंग

पाठ्यक्रम देखें

अभ्यास निर्देश

  • annotations_df DataFrame के कॉलम '_c0' को टैब कैरेक्टर पर स्प्लिट करके tmp_fields नाम का नया वैरिएबल बनाएँ.
  • पिछले स्टेप में बने फ़ील्ड्स की संख्या दर्शाने के लिए annotations_df में 'colcount' नाम का नया कॉलम जोड़ें.
  • annotations_df से वे सभी पंक्तियाँ फ़िल्टर कर दें जिनमें 5 से कम फ़ील्ड्स हैं.
  • DataFrame में पंक्तियों की संख्या गिनें और उसे initial_count से तुलना करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Split _c0 on the tab character and store the list in a variable
tmp_fields = ____(annotations_df['_c0'], ____)

# Create the colcount column on the DataFrame
annotations_df = annotations_df.____('____', ____(____))

# Remove any rows containing fewer than 5 fields
annotations_df_filtered = annotations_df.____(~ (____))

# Count the number of rows
final_count = ____
print("Initial count: %d\nFinal count: %d" % (initial_count, final_count))
कोड संपादित करें और चलाएँ