ПочатиПочніть безкоштовно

Інтерпретація результатів

Майже завжди важливо знати, які ознаки найбільше впливають на ваше передбачення. Можливо, це неочікувано — і вже дає інсайт? Або ж кілька ознак забезпечують більшу частину точності моделі, тож немає потреби витрачати час на збирання чи обробку інших ознак.

У цьому прикладі ми розглянемо модель, навчено без будь-якої інформації LISTPRICE. Коли цього немає, що найбільше впливає на ціну?

  • ПРИМІТКА: Масив важливостей ознак importances уже створено для вас за допомогою model.featureImportances.toArray()

Ця вправа є частиною курсу

Опрацювання ознак у PySpark

Переглянути курс

Інструкції до вправи

  • Створіть датафрейм pandas, використавши значення importances, і назвіть стовпець importance, установивши параметр columns.
  • Використовуючи імпортований список назв ознак feature_cols, створіть новий pandas.Series, обгорнувши його у функцію pd.Series(). Присвойте його стовпцю fi_df['feature'].
  • Відсортуйте датафрейм за допомогою sort_values(), встановивши параметр by на наш стовпець importance і відсортувавши за спаданням, установивши ascending у False. Перегляньте результати.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Convert feature importances to a pandas column
fi_df = pd.DataFrame(____, columns=[____])

# Convert list of feature names to pandas column
fi_df['feature'] = pd.____(____)

# Sort the data based on feature importance
fi_df.____(by=[____], ascending=____, inplace=True)

# Inspect Results
fi_df.head(10)
Редагувати та запускати код