Інтерпретація результатів
Майже завжди важливо знати, які ознаки найбільше впливають на ваше передбачення. Можливо, це неочікувано — і вже дає інсайт? Або ж кілька ознак забезпечують більшу частину точності моделі, тож немає потреби витрачати час на збирання чи обробку інших ознак.
У цьому прикладі ми розглянемо модель, навчено без будь-якої інформації LISTPRICE. Коли цього немає, що найбільше впливає на ціну?
- ПРИМІТКА: Масив важливостей ознак
importancesуже створено для вас за допомогоюmodel.featureImportances.toArray()
Ця вправа є частиною курсу
Опрацювання ознак у PySpark
Інструкції до вправи
- Створіть датафрейм
pandas, використавши значенняimportances, і назвіть стовпецьimportance, установивши параметрcolumns. - Використовуючи імпортований список назв ознак
feature_cols, створіть новийpandas.Series, обгорнувши його у функціюpd.Series(). Присвойте його стовпцюfi_df['feature']. - Відсортуйте датафрейм за допомогою
sort_values(), встановивши параметрbyна наш стовпецьimportanceі відсортувавши за спаданням, установившиascendingуFalse. Перегляньте результати.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Convert feature importances to a pandas column
fi_df = pd.DataFrame(____, columns=[____])
# Convert list of feature names to pandas column
fi_df['feature'] = pd.____(____)
# Sort the data based on feature importance
fi_df.____(by=[____], ascending=____, inplace=True)
# Inspect Results
fi_df.head(10)