शुरू करेंमुफ़्त में शुरू करें

आगे की पार्सिंग

आपने इस डेटासेट को पहले की तुलना में काफी अलग फ़ॉर्मेट में ढाला है, लेकिन अभी कुछ काम बाकी हैं। आपको आगे के विश्लेषण के लिए कॉलम डेटा को तैयार करना है और कुछ बीच के (intermediary) कॉलम हटाने हैं.

spark कॉन्टेक्स्ट उपलब्ध है और pyspark.sql.functions को F के रूप में एलियस किया गया है। pyspark.sql.types से टाइप्स पहले से इम्पोर्ट हैं। split_df DataFrame वैसा ही है जैसा आपने छोड़ा था। याद रखें, कॉलम नाम और टाइप्स देखने के लिए आप कंसोल एरिया में किसी DataFrame पर .printSchema() इस्तेमाल कर सकते हैं.

⚠️ नोट: अगर आपको AttributeError दिखे, तो अभ्यास रिफ्रेश करें और Run Solution पर क्लिक करें, Run Code पर क्लिक किए बिना.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ डेटा क्लीनिंग

पाठ्यक्रम देखें

अभ्यास निर्देश

  • retriever नाम का एक नया फंक्शन बनाएँ जो दो आर्ग्युमेंट ले: स्प्लिट कॉलम्स (cols) और कुल कॉलमों की संख्या (colcount)। यह फंक्शन ऐसी एंट्रीज़ की लिस्ट लौटाए जो अभी कॉलम के रूप में परिभाषित नहीं हुई हैं (अर्थात्, लिस्ट के आइटम 4 के बाद की सारी वैल्यूज़).
  • इस फंक्शन को Spark UDF के रूप में परिभाषित करें, जो strings की Array लौटाए।
  • उपलब्ध कॉलमों और UDF का उपयोग करके नया कॉलम dog_list बनाएँ.
  • कॉलम _c0, colcount, और split_cols हटाएँ.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

def retriever(____, ____):
  # Return a list of dog data
  return ____[4:____]

# Define the method as a UDF
udfRetriever = ____(____, ArrayType(____))

# Create a new column using your UDF
split_df = split_df.withColumn('dog_list', ____(____, ____))

# Remove the original column, split_cols, and the colcount
split_df = split_df.drop('____').____('____').____('____')
कोड संपादित करें और चलाएँ