Vẽ biểu đồ dữ liệu của bạn
Từ bài tập trước, chúng ta biết tỷ lệ quan sát gian lận so với không gian lận là rất thấp. Bạn có thể xử lý điều đó, ví dụ bằng cách lấy mẫu lại (re-sampling) dữ liệu, nội dung sẽ được giải thích trong video tiếp theo.
Trong bài này, bạn sẽ xem dữ liệu và trực quan hóa tỷ lệ gian lận so với không gian lận. Đây luôn là điểm khởi đầu tốt cho phân tích gian lận: hãy xem dữ liệu trước khi bạn thay đổi bất cứ điều gì.
Ngoài ra, khi trao đổi với đồng nghiệp, một hình ảnh thường giúp làm rõ rằng chúng ta đang làm việc với dữ liệu mất cân bằng nặng. Hãy tạo một biểu đồ để trực quan hóa tỷ lệ điểm dữ liệu gian lận so với không gian lận trên tập dữ liệu df.
Hàm prep_data() đã được nạp sẵn trong môi trường làm việc của bạn, cũng như matplotlib.pyplot dưới tên plt.
Bài tập này là một phần của khóa học
Phát hiện gian lận với Python
Hướng dẫn bài tập
Định nghĩa hàm
plot_data(X, y)để vẽ scatter plot đẹp cho tập đặc trưngXvới nhãny. Phần này đã được làm sẵn cho bạn.Dùng hàm
prep_data()trên tập dữ liệudfđể tạo tập đặc trưngXvà nhãny.Chạy hàm
plot_data()vớiXvàyvừa tạo để trực quan hóa kết quả.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Define a function to create a scatter plot of our data and labels
def plot_data(X, y):
plt.scatter(X[y == 0, 0], X[y == 0, 1], label="Class #0", alpha=0.5, linewidth=0.15)
plt.scatter(X[y == 1, 0], X[y == 1, 1], label="Class #1", alpha=0.5, linewidth=0.15, c='r')
plt.legend()
return plt.show()
# Create X and y from the prep_data function
X, y = prep_data(____)
# Plot our data by running our plot data function on X and y
____(X, y)