开始使用免费开始使用

识别极端值

现在,您已经创建了一个按州统计西班牙裔自我种族认同百分比的 DataFrame,接下来将进一步探索它,先用 seaborn 绘制箱线图。

您还将找出在特定种族类别中,西班牙裔占比最高或最低的州。为此,您将使用 squeeze() 方法。该方法会把只有 1 行的 DataFrame 转换为 Series(对多于 1 行的 DataFrame 无影响)。

已导入 pandas。DataFrame states_hr 已加载,包含 7 个不同种族类别的自我认同百分比。

本练习是课程的一部分

使用 Python 分析美国人口普查数据

查看课程

练习说明

  • 通过将 data 参数设置为 DataFrame 名称来创建箱线图。(orient = "h" 将把箱线图水平绘制,字母 h 表示 horizontal。)
  • 使用 squeeze,显示列 hispanic_white 中取值最大的州。
  • 使用 squeeze,显示列 hispanic_other 中取值最小的州。
  • 请注意,很少有西班牙裔将自己认同为 Asian,但有一个州是显著的高异常值。使用 squeeze,显示列 hispanic_asian 中取值最大的州。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import seaborn and matplotlib.plt
import matplotlib.pyplot as plt
import seaborn as sns
sns.set()

# Create a boxplot
sns.boxplot(data = ____, orient = "h")
plt.show()

# Show states with extreme values in various columns
print(states_hr.nlargest(1, ____).squeeze())
print(states_hr.nsmallest(____).____)
print(____)
编辑并运行代码