Bắt đầu ngayBắt đầu miễn phí

Kỹ thuật xử lý đa cộng tuyến - xây dựng đặc trưng

Đa cộng tuyến là một vấn đề phổ biến có thể ảnh hưởng đến hiệu năng trong bất kỳ bối cảnh Machine Learning nào. Biết cách bàn về chi tiết nhỏ này có thể giúp phần giải thích mô hình của bạn từ ổn lên xuất sắc và thật sự tạo khác biệt khi phỏng vấn.

Trong bài tập này, bạn sẽ thực hành tạo một mô hình cơ sở bằng Linear Regression trên bộ dữ liệu diabetes và khám phá một số chỉ số đầu ra. Sau đó, bạn sẽ luyện tập các kỹ thuật để trực quan hóa tương quan giữa các biến độc lập, rồi cuối cùng thực hiện feature engineering trên 2 biến có tương quan cao.

Với hai bước đầu tiên, hãy dùng X_train, X_test, y_trainy_test đã được nhập sẵn vào không gian làm việc của bạn.

Ngoài ra, mọi gói liên quan đã được nhập sẵn cho bạn: pandas dưới tên pd, train_test_split từ sklearn.model_selection, LinearRegression từ sklearn.linear_model, mean_squared_errorr2_score từ sklearn.metrics, matplotlib.pyplot dưới tên pltseaborn dưới tên sns.

Bài tập này là một phần của khóa học

Luyện tập câu hỏi phỏng vấn Machine Learning bằng Python

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Instantiate, fit, predict
lin_mod = ____()
lin_mod.____(____, ____)
y_pred = lin_mod.____(____)

# Coefficient estimates
print('Coefficients: \n', lin_mod.____)

# Mean squared error
print("Mean squared error: %.2f"
      % ____(____, ____))

# Explained variance score
print('R_squared score: %.2f' % ____(____, ____))
Chỉnh sửa và Chạy Mã