Điền các giá trị giả (dummy)
Tương tự như cách bạn đã kiểm tra mối liên hệ giữa giá trị thiếu với giá trị thiếu giữa các cột, việc tìm mối liên hệ giữa giá trị thiếu với giá trị không thiếu giữa các cột cũng rất quan trọng. Điều này giúp bạn nhận ra các yếu tố gây ra tình trạng thiếu dữ liệu.
Trong hình trên, bạn có thể thấy các giá trị thiếu của Serum Insulin phân bố khắp dải giá trị BMI. Điều này ngụ ý rằng không có mối liên hệ nào cả!
Trong bài tập này, bạn sẽ viết một hàm để tạo các giá trị giả (dummy) nhằm hỗ trợ vẽ biểu đồ scatter như trên (ở bài tập tiếp theo). Các thao tác tạo giá trị giả gồm: co giãn (scale) các giá trị ngẫu nhiên theo dải giá trị của cột với một hệ số co giãn và tịnh tiến (shift) các giá trị.
Hàm rand() đã được nhập sẵn cho bạn từ numpy.random.
Bài tập này là một phần của khóa học
Xử lý Dữ liệu Khuyết trong Python
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
def fill_dummy_values(df):
df_dummy = df.copy(deep=True)
for col_name in df_dummy:
col = df_dummy[col_name]
# Calculate column range
col_range = ___ - ___
return df_dummy