कस्टम Percentage स्केलिंग
स्लाइड्स में हमने दिखाया था कि डेटा को 0 और 1 के बीच कैसे स्केल किया जाता है। कभी-कभी मॉडलिंग या डिस्प्ले के लिए आप चीज़ों को अलग तरह से स्केल करना चाहेंगे।
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Feature Engineering
अभ्यास निर्देश
DAYSONMARKETका max और min निकालिए और उन्हेंmax_daysऔरmin_daysवैरिएबल में रखिए,agg()परcollect()का उपयोग करना न भूलिए।withColumn()का उपयोग करकेDAYSONMARKETके आधार पर 'percentagescaleddays' नाम का एक नया कॉलम बनाइए।percentage_scaled_daysएक इंटीजर कॉलम होना चाहिए जो 0 से 100 तक रेंज करे, इंटीजर पाने के लिएround()का उपयोग कीजिए।- नए कॉलम
percentage_scaled_daysके लिएmax()औरmin()प्रिंट कीजिए।
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Define max and min values and collect them
max_days = df.____({____: ____}).____()[0][0]
min_days = df.____({____: ____}).____()[0][0]
# Create a new column based off the scaled data
df = df.____(____,
____((df[____] - min_days) / (max_days - min_days)) * ____)
# Calc max and min for new column
print(df.____({____: ____}).____())
print(df.____({____: ____}).____())