Từ số 0 đến người hùng
Bạn đã thành thạo việc tạo đặc tả (specification) cho mô hình và chia dữ liệu thành tập huấn luyện và tập kiểm tra. Bạn cũng biết cách tránh mất cân bằng lớp khi chia dữ liệu. Giờ là lúc kết hợp những gì bạn vừa học và xây dựng mô hình chỉ với tập huấn luyện!
Bạn sẽ tạo một machine learning pipeline hoàn chỉnh. Quy trình này gồm: tạo đặc tả mô hình, chia dữ liệu thành tập huấn luyện và tập kiểm tra, và cuối cùng nhưng không kém phần quan trọng, fit mô hình trên dữ liệu huấn luyện. Chúc bạn học tốt!
Bài tập này là một phần của khóa học
Machine Learning với Mô hình Dựa trên Cây trong R
Hướng dẫn bài tập
- Tạo
diabetes_split, một split trong đó tập huấn luyện chứa ba phần tư số dòng củadiabetesvà cả tập huấn luyện lẫn tập kiểm tra đều có phân phối tương tự nhau ở biếnoutcome. - Xây dựng đặc tả cây quyết định cho mô hình của bạn dùng engine
rpartvà lưu làtree_spec. - Fit mô hình
model_trainedbằng dữ liệu huấn luyện củadiabetes_splitvớioutcomelà biến mục tiêu vàbmi,skin_thicknesslà các biến dự báo.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
set.seed(9)
# Create the balanced data split
diabetes_split <- ___
# Build the specification of the model
tree_spec <- ___ %>%
___ %>%
___
# Train the model
model_trained <- ___ %>%
fit(___,
___)
model_trained