Bắt đầu ngayBắt đầu miễn phí

Xây dựng mô hình random forest

Bạn sẽ tiếp tục làm việc với bộ dữ liệu Pima Indians để dự đoán một cá nhân có mắc bệnh tiểu đường hay không, lần này dùng bộ phân loại random forest. Bạn sẽ huấn luyện mô hình trên dữ liệu huấn luyện sau khi tách train-test và xem các giá trị mức độ quan trọng của đặc trưng.

Các tập dữ liệu đặc trưng và mục tiêu đã được nạp sẵn là Xy. Các gói và hàm cần thiết cũng đã được chuẩn bị sẵn.

Bài tập này là một phần của khóa học

Giảm Chiều Dữ Liệu với Python

Xem khóa học

Hướng dẫn bài tập

  • Đặt tỷ lệ kiểm tra 25% để thực hiện tách train-test theo tỷ lệ 75%-25%.
  • Huấn luyện bộ phân loại random forest trên dữ liệu huấn luyện.
  • Tính độ chính xác trên tập kiểm tra.
  • In mức độ quan trọng của từng đặc trưng.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Perform a 75% training and 25% test data split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=____, random_state=0)

# Fit the random forest model to the training data
rf = RandomForestClassifier(random_state=0)
rf.____(____, ____)

# Calculate the accuracy
acc = accuracy_score(____, ____)

# Print the importances per feature
print(dict(zip(X.columns, rf.____.round(2))))

# Print accuracy
print(f"{acc:.1%} accuracy on test set.") 
Chỉnh sửa và Chạy Mã