เวกเตอร์ BoW สำหรับรีวิวภาพยนตร์
ในแบบฝึกหัดนี้ มี pandas Series สองชุดให้แล้ว ได้แก่ X_train และ X_test ซึ่งประกอบด้วยรีวิวภาพยนตร์ โดยเป็นข้อมูลรีวิวสำหรับชุด training และชุด test ตามลำดับ โจทย์คือการ preprocess รีวิวเหล่านี้ แล้วสร้างเวกเตอร์ BoW สำหรับทั้งสองชุดด้วย CountVectorizer
เมื่อสร้าง matrix เวกเตอร์ BoW ได้แก่ X_train_bow และ X_test_bow แล้ว ก็จะพร้อมนำโมเดล machine learning มาใช้กับข้อมูลเหล่านี้เพื่อทำ sentiment analysis ต่อไป
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Feature Engineering for NLP in Python
คำแนะนำการฝึกหัด
- Import
CountVectorizerจากไลบรารีsklearn - สร้าง object
CountVectorizerชื่อvectorizerโดยให้แปลงคำทั้งหมดเป็นตัวพิมพ์เล็ก และลบ stopwords ภาษาenglishออก - ใช้
X_trainเพื่อ fitvectorizerจากนั้น transformX_trainเพื่อสร้างชุดเวกเตอร์ BoW ชื่อX_train_bow - Transform
X_testด้วยvectorizerเพื่อสร้างชุดเวกเตอร์ BoW ชื่อX_test_bow
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)
# Fit and transform X_train
X_train_bow = vectorizer.____(____)
# Transform X_test
X_test_bow = vectorizer.____(____)
# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)