Bắt đầu ngayBắt đầu miễn phí

Huấn luyện mô hình

Cuối cùng thì bạn cũng đã sẵn sàng huấn luyện các mô hình và chọn mô hình tốt nhất!

Đáng tiếc là cross validation tiêu tốn rất nhiều tài nguyên tính toán. Huấn luyện tất cả mô hình sẽ mất quá nhiều thời gian trên DataCamp.

Nếu chạy cục bộ, bạn sẽ dùng đoạn mã:

# Huấn luyện các mô hình cross validation
models = cv.fit(training)

# Trích xuất mô hình tốt nhất
best_lr = models.bestModel

Hãy nhớ, dữ liệu huấn luyện có tên là training và bạn đang dùng lr để khớp một mô hình logistic regression. Cross validation đã chọn giá trị tham số regParam=0elasticNetParam=0 là tốt nhất. Đây là các giá trị mặc định, nên bạn không cần làm gì thêm với lr trước khi huấn luyện mô hình.

Bài tập này là một phần của khóa học

Nền tảng về PySpark

Xem khóa học

Hướng dẫn bài tập

  • Tạo best_lr bằng cách gọi lr.fit() trên dữ liệu training.
  • In best_lr để kiểm tra rằng đây là một đối tượng thuộc lớp LogisticRegressionModel.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Call lr.fit()
best_lr = ____

# Print best_lr
print(____)
Chỉnh sửa và Chạy Mã