Bắt đầu ngayBắt đầu miễn phí

Cấu trúc của một mô hình Machine Learning

Giờ đây, bạn sẽ củng cố hiểu biết về cách dữ liệu ảnh hưởng đến hiệu năng mô hình. Bạn sẽ làm việc với bộ dữ liệu đặt phòng Airbnb (trong tệp booking.csv). Bộ dữ liệu này phù hợp cho bài toán phân loại nhằm dự đoán liệu một người có hủy đặt phòng hay không. Nó bao gồm nhiều cột số và phân loại. Bạn sẽ chia bộ dữ liệu đã cho thành ba mẫu loại trừ lẫn nhau — train_A.csv, train_B.csv, và test.csv — bằng script split_dataset.py. Sau đó, với mỗi bộ dữ liệu huấn luyện, bạn sẽ chạy pipeline xử lý dữ liệu và huấn luyện mô hình để huấn luyện một mô hình Random Forest Classifier và kiểm tra hiệu năng của nó trên tập kiểm tra bằng model_training.py. Các siêu tham số được định nghĩa trong params.json là nhất quán ở cả hai lần chạy.

Các script Python được thiết kế để nhận tham số dòng lệnh và chạy qua shell. Bạn có thể thoải mái khám phá các script này để hiểu sâu hơn.

Bài tập này là một phần của khóa học

Nhập môn Quản lý Phiên bản Dữ liệu với DVC

Xem khóa học

Bài tập tương tác thực hành

Biến lý thuyết thành hành động với một trong các bài tập tương tác của chúng tôi

Bắt đầu bài tập