Thiết kế một pipeline DVC
Thiết kế một pipeline DVC, hay DAG, là nền tảng để tận dụng DVC trong quy trình Machine Learning của bạn. DAG cho phép chúng ta mã hóa đầu vào, đầu ra và cách thực thi của từng bước. Đầu ra của một bước có thể trở thành đầu vào cho một hoặc nhiều bước khác, từ đó thiết lập tự nhiên các phụ thuộc phù hợp giữa các bước.
Trong bài tập này, bạn sẽ thiết kế một quy trình ML gồm bốn giai đoạn:
- Tiền xử lý dữ liệu (
preprocess_stage) - Chia dữ liệu (
split_stage) - Huấn luyện mô hình (
train_stage) - Đánh giá mô hình (
evaluate_stage)
Chúng ta sẽ chỉ làm việc với các lệnh dvc stage add. Nếu cần, hãy cuộn xuống cuối tệp shell script (dvc_dag_stages_add.sh).
Bài tập này là một phần của khóa học
Nhập môn Quản lý Phiên bản Dữ liệu với DVC
Bài tập tương tác thực hành
Biến lý thuyết thành hành động với một trong các bài tập tương tác của chúng tôi
Bắt đầu bài tập