मानों का बिनिंग
कई continuous मानों के लिए, किसी numeric कॉलम के सटीक मान से अधिक महत्वपूर्ण यह होता है कि वह किस bucket में आता है. यह plotting करते समय या अपने मशीन लर्निंग मॉडलों को सरल बनाने में उपयोगी होता है. इसे अधिकतर ऐसे continuous वैरिएबल्स पर इस्तेमाल किया जाता है जहाँ अत्यधिक सटीकता प्राथमिक चिंता नहीं होती, जैसे: उम्र, कद, वेतन.
Bins बनाने के लिए pd.cut(df['column_name'], bins) का उपयोग करें, जहाँ bins या तो एक integer हो सकता है जो समान दूरी वाले बिनों की संख्या बताता है, या फिर बिन boundaries की एक list हो सकती है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में मशीन लर्निंग के लिए फीचर इंजीनियरिंग
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Bin the continuous variable ConvertedSalary into 5 bins
so_survey_df['equal_binned'] = ____(so_survey_df['ConvertedSalary'], ____)
# Print the first 5 rows of the equal_binned column
print(so_survey_df[['equal_binned', 'ConvertedSalary']].head())