เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การใช้ pandas เพื่อนำเข้า flat file เป็น DataFrame (2)

ในแบบฝึกหัดที่แล้ว เราได้เรียนรู้วิธีนำเข้า flat file ลงใน pandas DataFrame แล้ว นอกจากนี้ยังสามารถแปลง DataFrame ดังกล่าวให้เป็นอาร์เรย์ numpy ได้โดยตรงด้วยเมธอด .to_numpy() ในแบบฝึกหัดนี้จะได้ลองทำสิ่งนี้กับชุดข้อมูล MNIST ซึ่งมีให้ในชื่อ digits.csv

มีอาร์กิวเมนต์หลายตัวของ pd.read_csv() ที่มีประโยชน์สำหรับแบบฝึกหัดนี้ ได้แก่:

  • nrows ใช้ระบุจำนวนแถวที่ต้องการอ่านจากไฟล์ ตัวอย่างเช่น nrows=10 จะนำเข้าเฉพาะ 10 แถวแรก
  • header รับหมายเลขแถวที่จะใช้เป็น label ของคอลัมน์ และกำหนดจุดเริ่มต้นของข้อมูล หากไฟล์ไม่มีแถว header ให้กำหนด header=None แล้ว pandas จะกำหนด label คอลัมน์เป็นจำนวนเต็มโดยอัตโนมัติ เริ่มจาก 0 (เช่น 0, 1, 2, …)

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Python เบื้องต้น: การนำเข้าข้อมูล

ดูคอร์ส

คำแนะนำการฝึกหัด

  • นำเข้า 5 แถวแรก ของไฟล์ลงใน DataFrame โดยใช้ฟังก์ชัน pd.read_csv() แล้วกำหนดผลลัพธ์ให้กับ data โดยต้องใช้อาร์กิวเมนต์ nrows และ header ทั้งนี้ไฟล์นี้ไม่มีแถว header
  • สร้างอาร์เรย์ numpy จาก DataFrame ใน data แล้วกำหนดให้กับ data_array
  • รัน print(type(data_array)) เพื่อแสดงประเภทข้อมูลของ data_array

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Assign the filename: file
file = 'digits.csv'

# Read the first 5 rows of the file into a DataFrame: data
data = ____(____, ____, ____)

# Build a numpy array from the DataFrame: data_array
data_array = ____

# Print the datatype of data_array to the shell
print(type(data_array))
แก้ไขและรันโค้ด