Bắt đầu ngayBắt đầu miễn phí

Mức độ quan trọng của biến

Bạn đã biết rằng bagged trees là một mô hình ensemble giúp khắc phục vấn đề phương sai cao của cây quyết định. Giờ đây, bạn học thêm rằng thuật toán random forest còn cải thiện hơn nữa bằng cách chỉ dùng một tập con ngẫu nhiên của các đặc trưng trong mỗi cây. Cách này làm giảm tương quan giữa các cây trong ensemble, từ đó cải thiện hiệu năng dự đoán.

Trong bài tập này, bạn sẽ tự xây dựng một random forest và vẽ mức độ quan trọng của các biến dự báo bằng gói vip. Dữ liệu huấn luyện customers_train đã được nạp sẵn trong không gian làm việc của bạn.

Bài tập này là một phần của khóa học

Machine Learning với Mô hình Dựa trên Cây trong R

Xem khóa học

Hướng dẫn bài tập

  • Tạo spec, đặc tả của một mô hình phân loại random forest dùng engine "ranger" và kiểu quan trọng biến "impurity".
  • Tạo model bằng cách fit tibble customers_train vào spec với still_customer là biến mục tiêu và tất cả các cột còn lại là biến dự báo.
  • Vẽ biểu đồ mức độ quan trọng của biến bằng hàm vip() từ gói vip (gói này chưa được nạp sẵn).

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Specify a random forest
spec <- ___ %>%
	set_mode("classification") %>%
    set_engine(___, importance = ___)

# Train the forest
model <- spec %>%
    fit(___,
        ___)

# Plot the variable importance
vip::___(model)
Chỉnh sửa và Chạy Mã