Trích xuất một tham số của Logistic Regression
Bây giờ bạn sẽ thực hành trích xuất một tham số quan trọng của mô hình logistic regression. Logistic regression còn có một vài tham số khác bạn sẽ không khám phá ở đây, nhưng có thể xem lại trong tài liệu scikit-learn.org cho mô-đun LogisticRegression() dưới mục 'Attributes'.
Tham số này quan trọng để hiểu chiều hướng và độ lớn ảnh hưởng của các biến lên biến mục tiêu.
Trong bài này, chúng ta sẽ trích xuất tham số hệ số (nằm trong thuộc tính coef_), ghép nó với tên cột gốc, và xem biến nào có tác động dương lớn nhất lên biến mục tiêu.
Bạn có sẵn:
- Một đối tượng mô hình logistic regression tên
log_reg_clf - DataFrame
X_train
sklearn và pandas đã được nhập cho bạn.
Bài tập này là một phần của khóa học
Tinh chỉnh siêu tham số trong Python
Hướng dẫn bài tập
- Tạo danh sách tên cột gốc được dùng trong DataFrame huấn luyện.
- Trích xuất các hệ số của bộ ước lượng logistic regression.
- Tạo một DataFrame gồm hệ số và tên biến rồi xem nó.
- In ra 3 biến 'dương' hàng đầu dựa trên độ lớn của hệ số.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create a list of original variable names from the training DataFrame
original_variables = ____
# Extract the coefficients of the logistic regression estimator
model_coefficients = ____.____[____]
# Create a dataframe of the variables and coefficients & print it out
coefficient_df = pd.DataFrame({"Variable" : ____, "Coefficient": ____})
print(coefficient_df)
# Print out the top 3 positive variables
top_three_df = coefficient_df.sort_values(by=____, axis=0, ascending=____)[0:____]
print(top_three_df)