शुरू करेंमुफ़्त में शुरू करें

कस्टम Percentage स्केलिंग

स्लाइड्स में हमने दिखाया था कि डेटा को 0 और 1 के बीच कैसे स्केल किया जाता है। कभी-कभी मॉडलिंग या डिस्प्ले के लिए आप चीज़ों को अलग तरह से स्केल करना चाहेंगे।

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Feature Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • DAYSONMARKET का max और min निकालिए और उन्हें max_days और min_days वैरिएबल में रखिए, agg() पर collect() का उपयोग करना न भूलिए।
  • withColumn() का उपयोग करके DAYSONMARKET के आधार पर 'percentagescaleddays' नाम का एक नया कॉलम बनाइए।
  • percentage_scaled_days एक इंटीजर कॉलम होना चाहिए जो 0 से 100 तक रेंज करे, इंटीजर पाने के लिए round() का उपयोग कीजिए।
  • नए कॉलम percentage_scaled_days के लिए max() और min() प्रिंट कीजिए।

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Define max and min values and collect them
max_days = df.____({____: ____}).____()[0][0]
min_days = df.____({____: ____}).____()[0][0]

# Create a new column based off the scaled data
df = df.____(____, 
                  ____((df[____] - min_days) / (max_days - min_days)) * ____)

# Calc max and min for new column
print(df.____({____: ____}).____())
print(df.____({____: ____}).____())
कोड संपादित करें और चलाएँ