Diễn giải kết quả
Hầu như luôn quan trọng phải biết những feature nào ảnh hưởng nhiều nhất đến dự đoán của bạn. Có thể điều đó đi ngược trực giác và chính là một phát hiện? Có thể chỉ một vài feature chiếm phần lớn độ chính xác của mô hình, và bạn không cần tốn thời gian thu thập hay xử lý các feature khác.
Trong ví dụ này, chúng ta sẽ xem một mô hình được huấn luyện mà không có bất kỳ thông tin LISTPRICE nào. Khi loại bỏ nó, yếu tố nào ảnh hưởng đến giá nhiều nhất?
- LƯU Ý: Mảng độ quan trọng của feature,
importances, đã được tạo sẵn cho bạn từmodel.featureImportances.toArray()
Bài tập này là một phần của khóa học
Feature Engineering với PySpark
Hướng dẫn bài tập
- Tạo một dataframe
pandastừ các giá trị củaimportancesvà đặt tên cột làimportancebằng cách thiết lập tham sốcolumns. - Sử dụng danh sách tên feature đã được import,
feature_cols, tạo mộtpandas.Seriesmới bằng cách bọc nó trong hàmpd.Series(). Gán nó cho cộtfi_df['feature']. - Sắp xếp dataframe bằng
sort_values(), đặt tham sốbylà cộtimportancevà sắp xếp giảm dần bằng cách đặtascendingthànhFalse. Kiểm tra kết quả.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Convert feature importances to a pandas column
fi_df = pd.DataFrame(____, columns=[____])
# Convert list of feature names to pandas column
fi_df['feature'] = pd.____(____)
# Sort the data based on feature importance
fi_df.____(by=[____], ascending=____, inplace=True)
# Inspect Results
fi_df.head(10)