Interpretowanie wyników
Niemal zawsze warto wiedzieć, które cechy mają największy wpływ na predykcję modelu. Może okaże się to zaskakujące – a to samo w sobie jest cenną obserwacją. Może też kilka cech odpowiada za większość dokładności modelu i nie trzeba poświęcać czasu na pozyskiwanie ani przetwarzanie pozostałych.
W tym ćwiczeniu przyjrzymy się modelowi, który był trenowany bez żadnych danych LISTPRICE. Skoro tej informacji brakuje – co najbardziej wpływa na cenę?
- UWAGA: Tablica ważności cech
importanceszostała już dla ciebie utworzona na podstawiemodel.featureImportances.toArray()
To ćwiczenie jest częścią kursu
Inżynieria cech z PySpark
Instrukcje do ćwiczenia
- Utwórz ramkę danych
pandas, używając wartości zimportances, i nadaj kolumnie nazwęimportance, ustawiając parametrcolumns. - Korzystając z zaimportowanej listy nazw cech
feature_cols, utwórz nową seriępandas.Series, opakowując ją w funkcjępd.Series(). Przypisz ją do kolumnyfi_df['feature']. - Posortuj ramkę danych za pomocą
sort_values(), ustawiając parametrbyna kolumnęimportancei sortując malejąco przez ustawienieascendingnaFalse. Przejrzyj wyniki.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Convert feature importances to a pandas column
fi_df = pd.DataFrame(____, columns=[____])
# Convert list of feature names to pandas column
fi_df['feature'] = pd.____(____)
# Sort the data based on feature importance
fi_df.____(by=[____], ascending=____, inplace=True)
# Inspect Results
fi_df.head(10)