โมเดล BoW สำหรับ tagline ภาพยนตร์
ในแบบฝึกหัดนี้ มี corpus ที่รวบรวม tagline ภาพยนตร์มากกว่า 7,000 รายการไว้ให้แล้ว งานของคุณคือสร้างการแทนค่าแบบ bag of words เป็น bow_matrix สำหรับ tagline เหล่านี้ ในแบบฝึกหัดนี้จะข้ามขั้นตอนการประมวลผลข้อความ แล้วสร้าง bow_matrix โดยตรงเลย
นอกจากนี้ยังจะสำรวจ shape ของ bow_matrix ที่ได้ด้วย โดย tagline 5 รายการแรกใน corpus ถูกพิมพ์ออกมาที่คอนโซลให้ตรวจสอบแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Feature Engineering for NLP in Python
คำแนะนำการฝึกหัด
- Import คลาส
CountVectorizerจากsklearn - สร้างออบเจกต์
CountVectorizerแล้วตั้งชื่อว่าvectorizer - ใช้
fit_transform()เพื่อสร้างbow_matrixจากcorpus
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create CountVectorizer object
____ = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Print the shape of bow_matrix
print(bow_matrix.shape)