Nhập tệp theo từng phần (chunk)
Khi làm việc với các tệp lớn, việc tải và xử lý dữ liệu theo từng phần có thể dễ dàng hơn. Hãy thực hành quy trình này với dữ liệu thuế của Vermont.
500 dòng đầu tiên đã được tải vào vt_data_first500. Bạn sẽ lấy 500 dòng tiếp theo. Để làm điều này, bạn sẽ dùng một số tham số: nrows và skiprows để lấy đúng bản ghi, header để báo cho pandas rằng dữ liệu không có tên cột, và names để cung cấp các tên cột còn thiếu. Bạn cũng sẽ dùng hàm list() để lấy danh sách tên cột từ vt_data_first500 để tái sử dụng.
pandas đã được nhập với bí danh pd.
Bài tập này là một phần của khóa học
Nạp dữ liệu gọn nhẹ với pandas
Hướng dẫn bài tập
- Dùng
nrowsvàskiprowsđể tạo một dataframe,vt_data_next500, gồm 500 dòng tiếp theo. - Thiết lập đối số
headerđểpandasbiết là không có hàng tiêu đề. - Đặt tên các cột cho
vt_data_next500bằng cách cung cấp danh sách các cột củavt_data_first500cho đối sốnames.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create dataframe of next 500 rows with labeled columns
vt_data_next500 = pd.read_csv("vt_tax_data_2016.csv",
____,
____,
____,
____)
# View the Vermont dataframes to confirm they're different
print(vt_data_first500.head())
print(vt_data_next500.head())