การจัดการชุดข้อมูล
ในงาน ML มักจะต้องจัดการชุดข้อมูลก่อนนำไปใช้งานเสมอ การจัดการที่พบบ่อยได้แก่ การกรอง (filtering) และการเลือก (selecting หรือ slicing) เนื่องจากชุดข้อมูลเหล่านี้มีขนาดใหญ่ Hugging Face จึงใช้ไฟล์ประเภท Arrow
ซึ่งหมายความว่าวิธีการจัดการข้อมูลจะแตกต่างจากที่คุ้นเคยอยู่บ้าง แต่ไม่ต้องกังวล มีเมธอดพร้อมให้ใช้งานอยู่แล้ว!
ชุดข้อมูลถูกโหลดไว้ให้แล้วในตัวแปร wikipedia
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การใช้งาน Hugging Face
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Filter the documents
____ = wikipedia.____(lambda row: "football" in row["____"])
# Create a sample dataset
example = ____.____(range(1))
print(example[0]["text"])