Mô hình CTR đầu tiên
Trong bài tập này, bạn sẽ xây dựng mô hình CTR đầu tiên trên bộ dữ liệu Avazu bằng cây quyết định và đánh giá độ chính xác của mô hình với accuracy_score() từ sklearn. Ngoài ra, bạn sẽ dùng train_test_split() từ sklearn để tách dữ liệu huấn luyện và kiểm tra thay vì tự xác định điểm tách như trước.
Trong không gian làm việc của bạn, dữ liệu mẫu dạng DataFrame đã được nạp dưới tên df, cùng với sklearn và pandas là pd.
Chúng ta sẽ thực hiện tách dữ liệu huấn luyện/kiểm tra cơ bản và đánh giá kết quả bằng accuracy.
Bài tập này là một phần của khóa học
Dự đoán CTR với Machine Learning trong Python
Hướng dẫn bài tập
- Xác định
Xvàylần lượt là đặc trưng và mục tiêu dựa trên cộtclick. - Chia dữ liệu thành tập huấn luyện và kiểm tra bằng
train_test_split(X, y). - Tạo một bộ phân loại cây quyết định.
- Tạo dự đoán bằng bộ phân loại và đánh giá độ chính xác của các dự đoán.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Define X and y
X = df.____[:, ~df.columns.____(['click'])]
y = df.click
# Define training and testing
X_train, X_test, y_train, y_test = \
____(____, _____, test_size = .2, random_state = 0)
# Create decision tree classifier
clf = ____()
# Train classifier - predict label and evaluate accuracy
y_pred = clf.fit(____, _____).____(X_test)
print(____(y_test, y_pred))