परिणामों की व्याख्या
यह जानना लगभग हमेशा ज़रूरी होता है कि आपकी prediction पर सबसे ज़्यादा असर किन features का है। हो सकता है यह आपकी सहज धारणा के विपरीत हो और वही एक नई insight हो। हो सकता है कुछ ही features आपके मॉडल की अधिकांश accuracy समझा दें और आपको बाकी features जुटाने या साफ़-सफ़ाई में समय न लगाना पड़े.
इस उदाहरण में हम ऐसे मॉडल को देखेंगे जिसे किसी भी LISTPRICE जानकारी के बिना train किया गया है। जब वह हटा दी गई है, तो कीमत पर सबसे अधिक प्रभाव किसका है?
- ध्यान दें: feature importances की array
importancesआपके लिए पहले सेmodel.featureImportances.toArray()से बनाई जा चुकी है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Feature Engineering
अभ्यास निर्देश
importancesके मानों का उपयोग करके एकpandasdataframe बनाइए औरcolumnsपैरामीटर सेट करके कॉलम का नामimportanceरखिए.- इम्पोर्ट की गई features के नामों की सूची
feature_colsसेpd.Series()फंक्शन में लपेटकर एक नयाpandas.Seriesबनाइए। इसे कॉलमfi_df['feature']में सेट कीजिए. - dataframe को
sort_values()से sort कीजिए, जहाँbyपैरामीटर हमारीimportanceकॉलम हो।ascendingकोFalseसेट करके descending क्रम में sort करें। नतीजों को देखें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Convert feature importances to a pandas column
fi_df = pd.DataFrame(____, columns=[____])
# Convert list of feature names to pandas column
fi_df['feature'] = pd.____(____)
# Sort the data based on feature importance
fi_df.____(by=[____], ascending=____, inplace=True)
# Inspect Results
fi_df.head(10)