นำเข้าไฟล์แบบแบ่งส่วน
เมื่อทำงานกับไฟล์ขนาดใหญ่ การโหลดและประมวลผลข้อมูลทีละส่วนจะสะดวกกว่า มาฝึกใช้วิธีนี้กับข้อมูลภาษีของรัฐเวอร์มอนต์กัน
500 แถวแรกถูกโหลดไว้แล้วในชื่อ vt_data_first500 และจะดึง 500 แถวถัดไป โดยใช้ keyword arguments หลายตัว ได้แก่ nrows และ skiprows สำหรับระบุแถวที่ต้องการ, header เพื่อบอก pandas ว่าข้อมูลไม่มีชื่อคอลัมน์ และ names สำหรับกำหนดชื่อคอลัมน์เอง นอกจากนี้ยังต้องใช้ฟังก์ชัน list() เพื่อดึงชื่อคอลัมน์จาก vt_data_first500 มาใช้ซ้ำ
มีการ import pandas ในชื่อ pd ไว้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การนำเข้าข้อมูลด้วย pandas อย่างมีประสิทธิภาพ
คำแนะนำการฝึกหัด
- ใช้
nrowsและskiprowsเพื่อสร้าง dataframe ชื่อvt_data_next500ที่มี 500 แถวถัดไป - กำหนดอาร์กิวเมนต์
headerเพื่อบอกpandasว่าไม่มีแถวส่วนหัวในข้อมูล - กำหนดชื่อคอลัมน์ให้
vt_data_next500โดยส่งรายการชื่อคอลัมน์จากvt_data_first500ไปยังอาร์กิวเมนต์names
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create dataframe of next 500 rows with labeled columns
vt_data_next500 = pd.read_csv("vt_tax_data_2016.csv",
____,
____,
____,
____)
# View the Vermont dataframes to confirm they're different
print(vt_data_first500.head())
print(vt_data_next500.head())