การคำนวณค่า D สำหรับรัฐหนึ่ง
ในแบบฝึกหัดนี้ จะคำนวณ Index of Dissimilarity สำหรับรัฐจอร์เจีย โดยสูตรของ Index of Dissimilarity คือ:
$$D = \frac{1}{2}\sum{\left\lvert \frac{a}{A} - \frac{b}{B} \right\rvert}$$
ในที่นี้ กลุ่ม A คือประชากรผิวขาว และกลุ่ม B คือประชากรผิวดำ โดย \(a\) และ \(b\) แทนจำนวนประชากรผิวขาวและผิวดำในพื้นที่ย่อย (tracts) ส่วน \(A\) และ \(B\) แทนจำนวนประชากรผิวขาวและผิวดำในพื้นที่รวม (รัฐจอร์เจีย รหัสไปรษณีย์ = GA รหัส FIPS = 13)
ได้นำเข้า pandas ด้วย alias ปกติแล้ว และโหลด DataFrame ชื่อ tracts ที่มีคอลัมน์ประชากร "white" และ "black" ไว้เรียบร้อยแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การวิเคราะห์ข้อมูลสำมะโนประชากรสหรัฐฯ ด้วย Python
คำแนะนำการฝึกหัด
- สร้าง DataFrame ใหม่ชื่อ
ga_tractsที่มีเฉพาะ tracts ในรัฐจอร์เจีย (คอลัมน์"state"ต้องมีค่าเท่ากับรหัส FIPS"13") - ระบุชื่อคอลัมน์ในรูปแบบ list (ใช้ตัวแปร
wและb) เพื่อแสดงผลรวมของประชากรผิวขาวที่ไม่ใช่ Hispanic และประชากรผิวดำในรัฐจอร์เจีย - นำจำนวนประชากรผิวขาวของแต่ละ tract หารด้วยผลรวมของประชากรผิวขาวทั้งหมด แล้วลบด้วยจำนวนประชากรผิวดำของแต่ละ tract หารด้วยผลรวมของประชากรผิวดำทั้งหมด โดยใช้ตัวแปร
wและbเพื่อให้โค้ดอ่านง่ายขึ้น
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Define convenience variables to hold column names
w = "white"
b = "black"
# Extract Georgia tracts
ga_tracts = tracts[____]
# Print sums of Black and White residents of Georgia
print(ga_tracts[____].sum())
# Calculate Index of Dissimilarity and print rounded result
D = 0.5 * sum(abs(
____ / ____ - ____ / ____))
print("Dissimilarity (Georgia):", round(D, 3))