Bắt đầu ngayBắt đầu miễn phí

Diễn giải kết quả

Hầu như luôn quan trọng phải biết những feature nào ảnh hưởng nhiều nhất đến dự đoán của bạn. Có thể điều đó đi ngược trực giác và chính là một phát hiện? Có thể chỉ một vài feature chiếm phần lớn độ chính xác của mô hình, và bạn không cần tốn thời gian thu thập hay xử lý các feature khác.

Trong ví dụ này, chúng ta sẽ xem một mô hình được huấn luyện mà không có bất kỳ thông tin LISTPRICE nào. Khi loại bỏ nó, yếu tố nào ảnh hưởng đến giá nhiều nhất?

  • LƯU Ý: Mảng độ quan trọng của feature, importances, đã được tạo sẵn cho bạn từ model.featureImportances.toArray()

Bài tập này là một phần của khóa học

Feature Engineering với PySpark

Xem khóa học

Hướng dẫn bài tập

  • Tạo một dataframe pandas từ các giá trị của importances và đặt tên cột là importance bằng cách thiết lập tham số columns.
  • Sử dụng danh sách tên feature đã được import, feature_cols, tạo một pandas.Series mới bằng cách bọc nó trong hàm pd.Series(). Gán nó cho cột fi_df['feature'].
  • Sắp xếp dataframe bằng sort_values(), đặt tham số by là cột importance và sắp xếp giảm dần bằng cách đặt ascending thành False. Kiểm tra kết quả.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Convert feature importances to a pandas column
fi_df = pd.DataFrame(____, columns=[____])

# Convert list of feature names to pandas column
fi_df['feature'] = pd.____(____)

# Sort the data based on feature importance
fi_df.____(by=[____], ascending=____, inplace=True)

# Inspect Results
fi_df.head(10)
Chỉnh sửa và Chạy Mã