शुरू करेंमुफ़्त में शुरू करें

Random forest feature importances

ट्री-आधारित मेथड्स का एक उपयोगी पहलू है feature importances निकालना. यह हर फीचर के हमारे प्रेडिक्शंस में योगदान को मापने का एक परिमाणात्मक तरीका देता है. इससे आप अपने बेहतरीन फीचर्स पर फोकस कर सकते हैं, उन्हें और बेहतर बना या ट्यून कर सकते हैं, और बेकार फीचर्स हटाने में भी मदद मिलती है जो मॉडल को जटिल बना रहे हों.

sklearn के ट्री मॉडल्स में .feature_importances_ नाम की property होती है, जो मॉडल फिट करने के बाद एक्सेस की जा सकती है. इसमें फीचर इम्पॉर्टेंस स्कोर्स रहते हैं. हमें np.argsort() का उपयोग करके sorted feature importances के इंडेक्स लेने हैं ताकि फीचर इम्पॉर्टेंस का एक अच्छा-सा बार प्लॉट बना सकें (सबसे अधिक से सबसे कम महत्व के क्रम में sorted).

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Finance के लिए Machine Learning

पाठ्यक्रम देखें

अभ्यास निर्देश

  • हमारे random forest मॉडल (rfr) की feature_importances_ property का उपयोग करके feature importances निकालें और उन्हें importances वैरिएबल में रखें.
  • numpy के argsort का उपयोग करके feature importances के इंडेक्स सबसे बड़े से सबसे छोटे क्रम में लें, और sorted इंडेक्स को sorted_index वैरिएबल में सेव करें.
  • labels वैरिएबल में xtick labels को फीचर नाम रखें, sorted_index लिस्ट का उपयोग करते हुए. feature_names को numpy array में कन्वर्ट करना होगा ताकि हम उसे sorted_index लिस्ट से इंडेक्स कर सकें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Get feature importances from our random forest model
importances = rfr.____

# Get the index of importances from greatest importance to least
sorted_index = ____(importances)[::-1]
x = range(len(importances))

# Create tick labels 
labels = np.array(____)[____]
plt.bar(x, importances[sorted_index], tick_label=labels)

# Rotate tick labels to vertical
plt.xticks(rotation=90)
plt.show()
कोड संपादित करें और चलाएँ