शुरू करेंमुफ़्त में शुरू करें

Splitting & Exploding

GARAGEDESCRIPTION जैसे किसी कंपाउंड फ़ील्ड को उपयोगी रूप में बदलना एक चरणबद्ध प्रक्रिया है। इसे फैलाकर (expand) आप क्या मूल्य निकाल सकते हैं, यह पहले से समझ लेना फायदेमंद होता है। इस उदाहरण में, हम अपनी string को list-जैसे array में बदलेंगे, उसे explode करेंगे, और फिर unique मानों को देखेंगे.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Feature Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • pyspark.sql.functions से ज़रूरी फंक्शन split() और explode() इम्पोर्ट करें।
  • split() का उपयोग करके df['GARAGEDESCRIPTION'] को ', ' (कॉमा और स्पेस) पर बाँटकर एक नया कॉलम garage_list बनाएँ।
  • explode() का प्रयोग करके df['garage_list'] के हर मान के लिए एक नया रिकॉर्ड बनाएँ और उसे नए कॉलम ex_garage_list में असाइन करें।
  • distinct() का उपयोग करके ex_garage_list के unique मान लें और पहले 100 रो show करें, जिनमें मानों को दिखाने के लिए 50 कैरेक्टर पर ट्रंकेट किया जाए.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import needed functions
____ ____ ____ ____, ____

# Convert string to list-like array
df = df.withColumn(____, ____(____, ____))

# Explode the values into new records
ex_df = df.withColumn(____, ____(____))

# Inspect the values
ex_df[['ex_garage_list']].____().____(100, ____=____)
कोड संपादित करें और चलाएँ