เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

TF-IDF ของเนื้อเรื่องภาพยนตร์

ลองนำเนื้อเรื่องของภาพยนตร์ที่สุ่มเลือกมาใช้ทำ document clustering กัน ก่อนจะ clustering เอกสาร จำเป็นต้องทำความสะอาดข้อมูลโดยกำจัด noise ที่ไม่ต้องการออกก่อน (เช่น อักขระพิเศษและ stop words) แล้วแปลงเป็น sparse matrix ด้วย TF-IDF

ใช้คลาส TfidfVectorizer เพื่อทำ TF-IDF กับเนื้อเรื่องภาพยนตร์ที่เก็บอยู่ใน list plots โดยฟังก์ชัน remove_noise() พร้อมใช้งานเป็น tokenizer ใน TfidfVectorizer เมธอด .fit_transform() จะ fit ข้อมูลเข้ากับออบเจ็กต์ TfidfVectorizer แล้วสร้าง TF-IDF sparse matrix ขึ้นมา

หมายเหตุ: เมธอด .fit_transform() ใช้เวลาประมวลผลสักครู่

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การวิเคราะห์กลุ่มข้อมูลใน Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • Import คลาส TfidfVectorizer จาก sklearn
  • Initialize คลาส TfidfVectorizer โดยกำหนดความถี่ขั้นต่ำและสูงสุดเป็น 0.1 และ 0.75 และจำนวน feature สูงสุด 50 รายการ
  • ใช้เมธอด fit_transform() กับคลาส TfidfVectorizer ที่ initialize ไว้แล้ว โดยส่ง list plots เข้าไป

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import TfidfVectorizer class from sklearn
from sklearn.feature_extraction.text import ____

# Initialize TfidfVectorizer
tfidf_vectorizer = TfidfVectorizer(____)

# Use the .fit_transform() method on the list plots
tfidf_matrix = ____
แก้ไขและรันโค้ด