Trực quan hóa các phép bù dữ liệu
Phân tích các phép bù dữ liệu và chọn ra cách tốt nhất là một nhiệm vụ đòi hỏi nhiều thử nghiệm. Điều quan trọng là phải đảm bảo dữ liệu của bạn không bị lệch trong quá trình bù. Trong hai bài tập vừa rồi, bạn đã tạo 4 cách bù khác nhau: dùng trung bình, trung vị, mode và điền hằng số.
Trong bài này, bạn sẽ tạo biểu đồ scatter cho các DataFrame mà bạn đã bù trước đó. Để làm được điều này, bạn sẽ tạo một từ điển các DataFrame với khóa là tiêu đề của chúng.
Các DataFrame diabetes_mean, diabetes_median, diabetes_mode và diabetes_constant đã được nạp sẵn cho bạn.
Bài tập này là một phần của khóa học
Xử lý Dữ liệu Khuyết trong Python
Hướng dẫn bài tập
- Tạo 4 biểu đồ con bằng cách vẽ một hình có 2 hàng và 2 cột.
- Tạo từ điển
imputationsbằng cách ánh xạ mỗi khóa với DataFrame tương ứng. - Lặp qua
axesvàimputations, và vẽ mỗi DataFrame trongimputations. - Đặt màu cho
nullityvà đặt tiêu đề cho mỗi biểu đồ con theo tên của phép bù.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Set nrows and ncols to 2
fig, axes = plt.subplots(nrows=___, ncols=___, figsize=(10, 10))
nullity = diabetes.Serum_Insulin.isnull()+diabetes.Glucose.isnull()
# Create a dictionary of imputations
imputations = {'Mean Imputation': ___, 'Median Imputation': ___,
'Most Frequent Imputation': ___, 'Constant Imputation': ___}
# Loop over flattened axes and imputations
for ax, df_key in zip(___.___(), ___):
# Select and also set the title for a DataFrame
imputations[___].plot(x='Serum_Insulin', y='Glucose', kind='scatter',
alpha=0.5, c=___, cmap='rainbow', ax=ax,
colorbar=False, title=___)
plt.show()