Dùng pandas để nhập flat file thành DataFrame (2)
Trong bài trước, bạn đã nhập được flat file vào một DataFrame của pandas. Thêm nữa, bạn có thể dễ dàng lấy mảng numpy tương ứng bằng phương thức .to_numpy(). Giờ bạn sẽ thực hành điều này với bộ dữ liệu MNIST, có sẵn dưới tên digits.csv.
Có một số đối số của pd.read_csv() sẽ hữu ích cho bài này:
nrowscho phép bạn chỉ định đọc bao nhiêu hàng từ tệp. Ví dụ,nrows=10sẽ chỉ nhập 10 hàng đầu tiên.headernhận số thứ tự hàng để dùng làm nhãn cột và đánh dấu điểm bắt đầu của dữ liệu. Nếu tệp không có hàng header, bạn có thể đặtheader=None, vàpandassẽ tự động gán nhãn cột là các số nguyên bắt đầu từ 0 (ví dụ: 0, 1, 2, …).
Bài tập này là một phần của khóa học
Nhập dữ liệu vào Python: Giới thiệu
Hướng dẫn bài tập
- Nhập 5 hàng đầu tiên của tệp vào một DataFrame bằng hàm
pd.read_csv()và gán kết quả chodata. Bạn sẽ cần dùng các đối sốnrowsvàheader. Lưu ý tệp này không có hàng header. - Tạo một mảng
numpytừ DataFrame thu được trongdatavà gán chodata_array. - Chạy
print(type(data_array))để in kiểu dữ liệu củadata_array.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Assign the filename: file
file = 'digits.csv'
# Read the first 5 rows of the file into a DataFrame: data
data = ____(____, ____, ____)
# Build a numpy array from the DataFrame: data_array
data_array = ____
# Print the datatype of data_array to the shell
print(type(data_array))