Bắt đầu ngayBắt đầu miễn phí

Trực quan hóa các phép bù dữ liệu

Phân tích các phép bù dữ liệu và chọn ra cách tốt nhất là một nhiệm vụ đòi hỏi nhiều thử nghiệm. Điều quan trọng là phải đảm bảo dữ liệu của bạn không bị lệch trong quá trình bù. Trong hai bài tập vừa rồi, bạn đã tạo 4 cách bù khác nhau: dùng trung bình, trung vị, mode và điền hằng số.

Trong bài này, bạn sẽ tạo biểu đồ scatter cho các DataFrame mà bạn đã bù trước đó. Để làm được điều này, bạn sẽ tạo một từ điển các DataFrame với khóa là tiêu đề của chúng.

Các DataFrame diabetes_mean, diabetes_median, diabetes_modediabetes_constant đã được nạp sẵn cho bạn.

Bài tập này là một phần của khóa học

Xử lý Dữ liệu Khuyết trong Python

Xem khóa học

Hướng dẫn bài tập

  • Tạo 4 biểu đồ con bằng cách vẽ một hình có 2 hàng và 2 cột.
  • Tạo từ điển imputations bằng cách ánh xạ mỗi khóa với DataFrame tương ứng.
  • Lặp qua axesimputations, và vẽ mỗi DataFrame trong imputations.
  • Đặt màu cho nullity và đặt tiêu đề cho mỗi biểu đồ con theo tên của phép bù.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Set nrows and ncols to 2
fig, axes = plt.subplots(nrows=___, ncols=___, figsize=(10, 10))
nullity = diabetes.Serum_Insulin.isnull()+diabetes.Glucose.isnull()

# Create a dictionary of imputations
imputations = {'Mean Imputation': ___, 'Median Imputation': ___, 
               'Most Frequent Imputation': ___, 'Constant Imputation': ___}

# Loop over flattened axes and imputations
for ax, df_key in zip(___.___(), ___):
    # Select and also set the title for a DataFrame
    imputations[___].plot(x='Serum_Insulin', y='Glucose', kind='scatter', 
                          alpha=0.5, c=___, cmap='rainbow', ax=ax, 
                          colorbar=False, title=___)
plt.show()
Chỉnh sửa và Chạy Mã