Bắt đầu ngayBắt đầu miễn phí

Bộ phân loại baseline bằng Logistic Regression

Trong 2 bài học trước, bạn đã thấy việc chọn đặc trưng quan trọng như thế nào trong bối cảnh phỏng vấn Machine Learning. Một nhóm câu hỏi phổ biến khác bạn có thể gặp liên quan đến kỹ thuật đặc trưng (feature engineering) và cách chúng giúp cải thiện hiệu năng mô hình.

Trong bài tập này, bạn sẽ tạo một đặc trưng mới trên bộ dữ liệu loan_data từ Chương 1, so sánh điểm chính xác của các mô hình Logistic Regression trên bộ dữ liệu trước và sau khi làm feature engineering bằng cách so sánh nhãn kiểm tra với giá trị dự đoán của biến mục tiêu Loan Status.

Tất cả các gói cần thiết đã được nhập sẵn cho bạn: matplotlib.pyplotplt, seabornsns, LogisticRegression từ sklearn.linear_model, train_test_split từ sklearn.model_selection, và accuracy_score từ sklearn.metrics.

Feature engineering được coi là một bước tiền xử lý trước khi xây dựng mô hình: Machine learning pipeline

Bài tập này là một phần của khóa học

Luyện tập câu hỏi phỏng vấn Machine Learning bằng Python

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Create X matrix and y array
X = loan_data.____("____", axis=1)
y = loan_data["____"]

# Train/test split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3, random_state=123)

# Instantiate
logistic = ____()

# Fit
logistic.____(____, ____)

# Predict and print accuracy
print(____(y_true=____, y_pred=logistic.____(____)))
Chỉnh sửa và Chạy Mã