Trực quan hóa phân phối thu nhập quốc tế
seaborn là một thư viện trực quan hóa dữ liệu thống kê trong Python, xây dựng trên matplotlib.
Mặc định, hàm distplot() trong gói seaborn tạo một histogram (biểu đồ tần suất), trong đó dữ liệu được gom theo khoảng và hiển thị dưới dạng các cột, đồng thời khớp một kernel density estimation (KDE), tức biểu đồ tần suất được làm mượt. Bạn cũng có thể dùng distplot() để tạo một loại đồ thị khác gọi là rugplot, thêm các dấu gạch ở phía dưới biểu đồ để cho biết mật độ quan sát dọc theo trục x.
seaborn.distplot(a, bins=None, hist=True, kde=True, rug=False, ...)
Ở các bài trước, bạn đã tạo một biểu đồ phân vị (quantile plot) giúp nắm khá chi tiết mức thu nhập bình quân đầu người tại các điểm khác nhau của phân phối. Ở đây, bạn sẽ dùng distplot() để có cái nhìn toàn cảnh!
pandas đã được nhập với bí danh pd, và DataFrame income từ bài trước có sẵn trong không gian làm việc của bạn.
Bài tập này là một phần của khóa học
Nhập và quản lý dữ liệu tài chính bằng Python
Hướng dẫn bài tập
- Import
seabornlàsnsvàmatplotlib.pyplotlàplt. - In thống kê tóm tắt do
.describe()cung cấp. - Vẽ và hiển thị một histogram cơ bản của cột
'Income per Capita'với.distplot(). - Tạo và hiển thị một rugplot cho cùng dữ liệu bằng cách đặt thêm các đối số
binsbằng 50,kdelàFalse, vàruglàTrue.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import seaborn and matplotlib
____
____
# Print the summary statistics for income
print(____.____())
# Plot a basic histogram of income per capita
____
# Show the plot
plt.show()
# Plot a rugplot
sns.distplot(income['Income per Capita'], ____, ____, ____)
# Show the plot
plt.show()