Splitting & Exploding
GARAGEDESCRIPTION जैसे किसी कंपाउंड फ़ील्ड को उपयोगी रूप में बदलना एक चरणबद्ध प्रक्रिया है। इसे फैलाकर (expand) आप क्या मूल्य निकाल सकते हैं, यह पहले से समझ लेना फायदेमंद होता है। इस उदाहरण में, हम अपनी string को list-जैसे array में बदलेंगे, उसे explode करेंगे, और फिर unique मानों को देखेंगे.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Feature Engineering
अभ्यास निर्देश
pyspark.sql.functionsसे ज़रूरी फंक्शनsplit()औरexplode()इम्पोर्ट करें।split()का उपयोग करकेdf['GARAGEDESCRIPTION']को ', ' (कॉमा और स्पेस) पर बाँटकर एक नया कॉलमgarage_listबनाएँ।explode()का प्रयोग करकेdf['garage_list']के हर मान के लिए एक नया रिकॉर्ड बनाएँ और उसे नए कॉलमex_garage_listमें असाइन करें।distinct()का उपयोग करकेex_garage_listके unique मान लें और पहले 100 रोshowकरें, जिनमें मानों को दिखाने के लिए 50 कैरेक्टर पर ट्रंकेट किया जाए.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import needed functions
____ ____ ____ ____, ____
# Convert string to list-like array
df = df.withColumn(____, ____(____, ____))
# Explode the values into new records
ex_df = df.withColumn(____, ____(____))
# Inspect the values
ex_df[['ex_garage_list']].____().____(100, ____=____)