Bắt đầu ngayBắt đầu miễn phí

Đánh giá sản phẩm với regularization

Trong bài này, bạn sẽ tiếp tục làm việc với bộ dữ liệu reviews gồm các đánh giá sản phẩm trên Amazon. Vector nhãn y chứa sentiment: 1 nếu tích cực và 0 nếu không. Ma trận X chứa tất cả đặc trưng số được tạo bằng phương pháp BOW.

Bạn sẽ cần huấn luyện hai mô hình logistic regression với các mức regularization khác nhau và so sánh hiệu năng của chúng trên dữ liệu kiểm tra. Hãy nhớ rằng regularization là cách kiểm soát độ phức tạp của mô hình. Mức regularization càng cao thì mô hình càng kém linh hoạt nhưng có khả năng khái quát hóa tốt hơn. Các mô hình có mức regularization cao thường kém chính xác hơn so với mô hình không regularization.

Bài tập này là một phần của khóa học

Phân tích cảm xúc với Python

Xem khóa học

Hướng dẫn bài tập

  • Chia dữ liệu thành tập huấn luyện và tập kiểm tra.
  • Huấn luyện một mô hình logistic regression với tham số regularization 1000. Huấn luyện mô hình logistic regression thứ hai với tham số regularization bằng 0.001.
  • In ra điểm accuracy của cả hai mô hình trên tập kiểm tra.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Split data into training and testing
____, ____, ____, ____ = train_test_split(____, ____, test_size=0.2, random_state=123)

# Train a logistic regression with regularization of 1000
log_reg1 = ____(____=1000).fit(X_train, y_train)
# Train a logistic regression with regularization of 0.001
log_reg2 = ____(____=0.001).fit(X_train, y_train)

# Print the accuracies
print('Accuracy of model 1: ', log_reg1.____(____, ____))
print('Accuracy of model 2: ', log_reg2.____(____, ____))
Chỉnh sửa và Chạy Mã