โหลดข้อมูลสำมะโนประชากร
มาเริ่มสร้าง PySpark DataFrame แรกของคุณกันเลย! ไฟล์ adult_reduced.csv มีข้อมูลการจัดกลุ่มผู้ใหญ่ตามหมวดหมู่ประชากรศาสตร์ต่าง ๆ ซึ่งปรับมาจากข้อมูลสำมะโนประชากรของสหรัฐอเมริกา โดยมีข้อมูลทั้งหมด 32,562 กลุ่ม
ลองโหลดไฟล์ CSV แล้วดูสคีมาที่ได้
พจนานุกรมข้อมูล:
| ตัวแปร | คำอธิบาย |
|---|---|
| age | อายุของบุคคล |
| education_num | ระดับการศึกษา |
| marital_status | สถานภาพสมรส |
| occupation | อาชีพ |
| income | รายได้แบบหมวดหมู่ |
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
PySpark เบื้องต้น
คำแนะนำการฝึกหัด
- สร้าง PySpark DataFrame จากไฟล์
"adult_reduced.csv"โดยใช้เมธอดspark.read.csv() - แสดง DataFrame ที่ได้
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Read in the CSV
census_adult = ____.____.____(____)
# Show the DataFrame
census_adult.____