การใช้ pandas เพื่อนำเข้า flat file เป็น DataFrame (2)
ในแบบฝึกหัดที่แล้ว เราได้เรียนรู้วิธีนำเข้า flat file ลงใน pandas DataFrame แล้ว นอกจากนี้ยังสามารถแปลง DataFrame ดังกล่าวให้เป็นอาร์เรย์ numpy ได้โดยตรงด้วยเมธอด .to_numpy() ในแบบฝึกหัดนี้จะได้ลองทำสิ่งนี้กับชุดข้อมูล MNIST ซึ่งมีให้ในชื่อ digits.csv
มีอาร์กิวเมนต์หลายตัวของ pd.read_csv() ที่มีประโยชน์สำหรับแบบฝึกหัดนี้ ได้แก่:
nrowsใช้ระบุจำนวนแถวที่ต้องการอ่านจากไฟล์ ตัวอย่างเช่นnrows=10จะนำเข้าเฉพาะ 10 แถวแรกheaderรับหมายเลขแถวที่จะใช้เป็น label ของคอลัมน์ และกำหนดจุดเริ่มต้นของข้อมูล หากไฟล์ไม่มีแถว header ให้กำหนดheader=Noneแล้วpandasจะกำหนด label คอลัมน์เป็นจำนวนเต็มโดยอัตโนมัติ เริ่มจาก 0 (เช่น 0, 1, 2, …)
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Python เบื้องต้น: การนำเข้าข้อมูล
คำแนะนำการฝึกหัด
- นำเข้า 5 แถวแรก ของไฟล์ลงใน DataFrame โดยใช้ฟังก์ชัน
pd.read_csv()แล้วกำหนดผลลัพธ์ให้กับdataโดยต้องใช้อาร์กิวเมนต์nrowsและheaderทั้งนี้ไฟล์นี้ไม่มีแถว header - สร้างอาร์เรย์
numpyจาก DataFrame ในdataแล้วกำหนดให้กับdata_array - รัน
print(type(data_array))เพื่อแสดงประเภทข้อมูลของdata_array
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Assign the filename: file
file = 'digits.csv'
# Read the first 5 rows of the file into a DataFrame: data
data = ____(____, ____, ____)
# Build a numpy array from the DataFrame: data_array
data_array = ____
# Print the datatype of data_array to the shell
print(type(data_array))