Random Forest: xây dựng mô hình
Giống như gradient boosted trees, random forests là một dạng ensemble model khác. Tức là, chúng dùng rất nhiều mô hình đơn giản (lại là decision trees) và kết hợp chúng để tạo ra một mô hình tốt hơn. Thay vì chạy lặp đi lặp lại cùng một mô hình, random forests chạy nhiều mô hình riêng biệt song song, mỗi mô hình trên một tập con dữ liệu được chọn ngẫu nhiên, với một tập con đặc trưng được chọn ngẫu nhiên. Sau đó, cây quyết định cuối cùng đưa ra dự đoán bằng cách tổng hợp kết quả từ từng mô hình thành phần.
Hàm random forest của sparklyr là ml_random_forest(). Cách dùng của nó hoàn toàn giống với ml_gradient_boosted_trees() (xem bài tập đầu tiên của chương này để nhắc lại cú pháp).
Bài tập này là một phần của khóa học
Nhập môn Spark với sparklyr trong R
Hướng dẫn bài tập
Kết nối Spark đã được tạo sẵn cho bạn dưới tên spark_conn. Một tibble gắn với dữ liệu siêu dữ liệu/bản chất âm sắc (timbre) của track đã được kết hợp và lọc, lưu trên Spark, đã được định nghĩa sẵn là track_data_to_model_tbl.
- Lặp lại phân tích dự đoán năm phát hành, lần này dùng mô hình random forest.
- Lấy các cột
timbretừtrack_data_to_model_tblvà gán kết quả chofeature_colnames. - Tạo công thức cho mô hình bằng
reformulate(). - Chạy mô hình random forest và gán kết quả cho
random_forest_model.
- Lấy các cột
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# track_data_to_model_tbl has been pre-defined
track_data_to_model_tbl
# Get the timbre columns
feature_colnames <- ___
# Create the formula for the model
year_formula <- ___
# Run the random forest model
random_forest_model <- ___