เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

เวกเตอร์ BoW สำหรับรีวิวภาพยนตร์

ในแบบฝึกหัดนี้ มี pandas Series สองชุดให้แล้ว ได้แก่ X_train และ X_test ซึ่งประกอบด้วยรีวิวภาพยนตร์ โดยเป็นข้อมูลรีวิวสำหรับชุด training และชุด test ตามลำดับ โจทย์คือการ preprocess รีวิวเหล่านี้ แล้วสร้างเวกเตอร์ BoW สำหรับทั้งสองชุดด้วย CountVectorizer

เมื่อสร้าง matrix เวกเตอร์ BoW ได้แก่ X_train_bow และ X_test_bow แล้ว ก็จะพร้อมนำโมเดล machine learning มาใช้กับข้อมูลเหล่านี้เพื่อทำ sentiment analysis ต่อไป

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Feature Engineering for NLP in Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • Import CountVectorizer จากไลบรารี sklearn
  • สร้าง object CountVectorizer ชื่อ vectorizer โดยให้แปลงคำทั้งหมดเป็นตัวพิมพ์เล็ก และลบ stopwords ภาษา english ออก
  • ใช้ X_train เพื่อ fit vectorizer จากนั้น transform X_train เพื่อสร้างชุดเวกเตอร์ BoW ชื่อ X_train_bow
  • Transform X_test ด้วย vectorizer เพื่อสร้างชุดเวกเตอร์ BoW ชื่อ X_test_bow

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)

# Fit and transform X_train
X_train_bow = vectorizer.____(____)

# Transform X_test
X_test_bow = vectorizer.____(____)

# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)
แก้ไขและรันโค้ด