TF-IDF ของเนื้อเรื่องภาพยนตร์
ลองนำเนื้อเรื่องของภาพยนตร์ที่สุ่มเลือกมาใช้ทำ document clustering กัน ก่อนจะ clustering เอกสาร จำเป็นต้องทำความสะอาดข้อมูลโดยกำจัด noise ที่ไม่ต้องการออกก่อน (เช่น อักขระพิเศษและ stop words) แล้วแปลงเป็น sparse matrix ด้วย TF-IDF
ใช้คลาส TfidfVectorizer เพื่อทำ TF-IDF กับเนื้อเรื่องภาพยนตร์ที่เก็บอยู่ใน list plots โดยฟังก์ชัน remove_noise() พร้อมใช้งานเป็น tokenizer ใน TfidfVectorizer เมธอด .fit_transform() จะ fit ข้อมูลเข้ากับออบเจ็กต์ TfidfVectorizer แล้วสร้าง TF-IDF sparse matrix ขึ้นมา
หมายเหตุ: เมธอด .fit_transform() ใช้เวลาประมวลผลสักครู่
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การวิเคราะห์กลุ่มข้อมูลใน Python
คำแนะนำการฝึกหัด
- Import คลาส
TfidfVectorizerจากsklearn - Initialize คลาส
TfidfVectorizerโดยกำหนดความถี่ขั้นต่ำและสูงสุดเป็น 0.1 และ 0.75 และจำนวน feature สูงสุด 50 รายการ - ใช้เมธอด
fit_transform()กับคลาสTfidfVectorizerที่ initialize ไว้แล้ว โดยส่ง listplotsเข้าไป
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import TfidfVectorizer class from sklearn
from sklearn.feature_extraction.text import ____
# Initialize TfidfVectorizer
tfidf_vectorizer = TfidfVectorizer(____)
# Use the .fit_transform() method on the list plots
tfidf_matrix = ____