Bắt đầu ngayBắt đầu miễn phí

Logistic regression là gì?

Mô hình bạn sẽ fit trong chương này gọi là logistic regression. Mô hình này rất giống với linear regression, nhưng thay vì dự đoán một biến số, nó dự đoán xác suất (từ 0 đến 1) của một sự kiện.

Để dùng mô hình này như một thuật toán phân loại, bạn chỉ cần đặt một ngưỡng cắt cho các xác suất. Nếu xác suất dự đoán vượt ngưỡng, bạn phân loại quan sát đó là 'có' (trong trường hợp này là chuyến bay bị trễ); nếu thấp hơn, bạn phân loại là 'không'!

Bạn sẽ tinh chỉnh mô hình này bằng cách thử các giá trị khác nhau cho một số siêu tham số. Một siêu tham số chỉ đơn giản là một giá trị trong mô hình không được ước lượng từ dữ liệu, mà do người dùng cung cấp để tối đa hóa hiệu năng. Trong khóa học này, bạn không cần hiểu toán học đằng sau tất cả các giá trị đó — điều quan trọng là bạn sẽ thử vài lựa chọn khác nhau và chọn ra phương án tốt nhất.

Tại sao bạn lại cung cấp các siêu tham số?

Bài tập này là một phần của khóa học

Nền tảng về PySpark

Xem khóa học

Bài tập tương tác thực hành

Biến lý thuyết thành hành động với một trong các bài tập tương tác của chúng tôi

Bắt đầu bài tập