找出極端值
你已經建立一個按州別計算,西語裔自我認定各種族別比例的 DataFrame,接下來要更深入探索,先用 seaborn 繪製箱型圖。
你也會找出在特定族別中,西語裔比例最高或最低的州。為了做到這點,你會套用 squeeze() 方法。這個方法會把只有 1 列的 DataFrame 轉成 Series(對於多於 1 列的 DataFrame 則不會有影響)。
已經匯入 pandas。DataFrame states_hr 已載入,內含 7 個不同族別分類的西語裔自我認定比例。
本練習屬於課程
使用 Python 分析美國 Census 資料
練習說明
- 建立箱型圖,將
data參數設為該 DataFrame 的名稱。(orient = "h"會把箱型圖畫成水平方向;h 代表 horizontal。) - 使用
squeeze,顯示欄位hispanic_white中數值最大的州。 - 使用
squeeze,顯示欄位hispanic_other中數值最小的州。 - 注意到認同為 Asian 的西語裔比例非常少,但有一個州是很高的離群值。使用
squeeze,顯示欄位hispanic_asian中數值最大的州。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import seaborn and matplotlib.plt
import matplotlib.pyplot as plt
import seaborn as sns
sns.set()
# Create a boxplot
sns.boxplot(data = ____, orient = "h")
plt.show()
# Show states with extreme values in various columns
print(states_hr.nlargest(1, ____).squeeze())
print(states_hr.nsmallest(____).____)
print(____)