शुरू करेंमुफ़्त में शुरू करें

लॉग ट्रांसफॉर्मेशन

पिछले अभ्यासों में आपने डेटा को रैखिक रूप से स्केल किया था, जो डेटा के आकार (shape) को प्रभावित नहीं करता। यह तब बढ़िया काम करता है जब आपका डेटा सामान्य वितरण (normally distributed) में हो या उसके काफ़ी क़रीब हो — यह धारणा कई मशीन लर्निंग मॉडल मानते हैं। कभी-कभी आप ऐसे डेटा पर काम करेंगे जो सामान्यता के क़रीब होता है, जैसे किसी आबादी की लंबाई या वज़न। दूसरी तरफ, वास्तविक दुनिया के कई वैरिएबल इस पैटर्न का पालन नहीं करते, जैसे वेतन या किसी आबादी की आयु। इस अभ्यास में आप so_numeric_df DataFrame के ConvertedSalary कॉलम पर लॉग ट्रांसफॉर्म लगाएँगे, क्योंकि इसका बड़ा हिस्सा निचले मूल्यों के आसपास केंद्रित है, लेकिन इसमें बहुत ऊँचे मूल्य भी मौजूद हैं। ऐसे वितरणों को "लंबी दाहिनी पूँछ" (long right tail) वाला कहा जाता है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में मशीन लर्निंग के लिए फीचर इंजीनियरिंग

पाठ्यक्रम देखें

अभ्यास निर्देश

  • sklearn के preprocessing मॉड्यूल से PowerTransformer इम्पोर्ट करें.
  • PowerTransformer() को pow_trans नाम से इंस्टैंशिएट करें.
  • so_numeric_df के ConvertedSalary कॉलम पर PowerTransformer को फिट करें.
  • अभी जो स्केलर आपने फिट किया है, उसी से उसी कॉलम को ट्रांसफॉर्म करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import PowerTransformer
from sklearn.preprocessing import ____

# Instantiate PowerTransformer
pow_trans = ____

# Train the transform on the data
____

# Apply the power transform to the data
so_numeric_df['ConvertedSalary_LG'] = ____(so_numeric_df[['ConvertedSalary']])

# Plot the data before and after the transformation
so_numeric_df[['ConvertedSalary', 'ConvertedSalary_LG']].hist()
plt.show()
कोड संपादित करें और चलाएँ