การสร้างคอลัมน์ Categorical
กลับมาที่ชุดข้อมูลภาพยนตร์จาก streaming startup อีกครั้ง คอลัมน์ original_language ส่วนใหญ่มีรหัสซ้ำกันเพียงไม่กี่ค่า เช่น en, fr, es การแปลงเป็น Categorical จะเข้ารหัสแต่ละ label ที่ไม่ซ้ำกันเป็นจำนวนเต็มเบื้องหลัง ช่วยลดการใช้หน่วยความจำสำหรับสตริงที่ซ้ำกัน
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การปรับขนาดและเพิ่มประสิทธิภาพ Data Pipeline ด้วย Polars
คำแนะนำการฝึกหัด
- แปลงคอลัมน์
original_languageให้เป็นpl.Categorical
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
movies_cat = movies.with_columns(
# Cast to Categorical to save memory
pl.col("original_language").____(pl.____)
)
result = movies_cat.select("movie_title", "original_language").head(8)
print(result)