Phân nhóm (binning) dữ liệu
Khi dữ liệu trên trục x là giá trị liên tục, việc chia nó thành các bin khác nhau có thể hữu ích để trực quan hóa rõ hơn những thay đổi trong dữ liệu.
Trong bài này, bạn sẽ xem mối quan hệ giữa học phí (Tuition) và quy mô sinh viên đại học hệ chính quy, viết tắt là UG trong dữ liệu này. Ta sẽ bắt đầu với biểu đồ phân tán của dữ liệu và xem xét ảnh hưởng của các kích thước bin khác nhau đến phần trực quan hóa.
Bài tập này là một phần của khóa học
Trực quan hóa dữ liệu nâng cao với Seaborn
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create a scatter plot by disabling the regression line
sns.regplot(data=df,
y='Tuition',
x='UG',
fit_reg=____)
plt.show()
plt.clf()