识别极端值
现在,您已经创建了一个按州统计西班牙裔自我种族认同百分比的 DataFrame,接下来将进一步探索它,先用 seaborn 绘制箱线图。
您还将找出在特定种族类别中,西班牙裔占比最高或最低的州。为此,您将使用 squeeze() 方法。该方法会把只有 1 行的 DataFrame 转换为 Series(对多于 1 行的 DataFrame 无影响)。
已导入 pandas。DataFrame states_hr 已加载,包含 7 个不同种族类别的自我认同百分比。
本练习是课程的一部分
使用 Python 分析美国人口普查数据
练习说明
- 通过将
data参数设置为 DataFrame 名称来创建箱线图。(orient = "h"将把箱线图水平绘制,字母 h 表示 horizontal。) - 使用
squeeze,显示列hispanic_white中取值最大的州。 - 使用
squeeze,显示列hispanic_other中取值最小的州。 - 请注意,很少有西班牙裔将自己认同为 Asian,但有一个州是显著的高异常值。使用
squeeze,显示列hispanic_asian中取值最大的州。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import seaborn and matplotlib.plt
import matplotlib.pyplot as plt
import seaborn as sns
sns.set()
# Create a boxplot
sns.boxplot(data = ____, orient = "h")
plt.show()
# Show states with extreme values in various columns
print(states_hr.nlargest(1, ____).squeeze())
print(states_hr.nsmallest(____).____)
print(____)