or
Bài tập này là một phần của khóa học
Spark là một framework để làm việc với Big Data. Trong chương này, bạn sẽ tìm hiểu bối cảnh về Spark và Machine Learning. Sau đó, bạn sẽ biết cách kết nối tới Spark bằng Python và tải dữ liệu CSV.
Giờ bạn đã quen với việc đưa dữ liệu vào Spark, chúng ta sẽ chuyển sang xây dựng hai loại mô hình phân loại: Decision Trees và Logistic Regression. Bạn cũng sẽ tìm hiểu một vài cách tiếp cận để chuẩn bị dữ liệu.
Tiếp theo, bạn sẽ học cách tạo các mô hình Linear Regression. Bạn cũng sẽ biết cách tăng cường dữ liệu bằng cách xây dựng các biến dự báo mới cũng như một cách tiếp cận vững chắc để chỉ chọn những biến dự báo liên quan nhất.
Bài tập hiện tại
Cuối cùng, bạn sẽ học cách làm cho mô hình hiệu quả hơn. Bạn sẽ biết cách dùng pipelines để giúp mã rõ ràng và dễ bảo trì hơn. Sau đó, bạn sẽ dùng cross-validation để kiểm tra mô hình tốt hơn và chọn tham số phù hợp. Cuối cùng, bạn sẽ thực hành với hai loại mô hình ensemble.