วิเคราะห์มิติข้อมูลและการประมวลผลล่วงหน้า
ในแบบฝึกหัดนี้ มี lem_corpus ให้แล้ว ซึ่งเก็บเวอร์ชันที่ผ่านการประมวลผลล่วงหน้าของแท็กไลน์ภาพยนตร์จากแบบฝึกหัดก่อนหน้า กล่าวคือ แท็กไลน์เหล่านั้นถูกแปลงเป็นตัวพิมพ์เล็ก ผ่านการทำ lemmatization และลบ stopwords ออกแล้ว
โจทย์คือสร้างการแทนค่าแบบ bag of words ชื่อ bow_lem_matrix จากแท็กไลน์ที่ผ่านการทำ lemmatization เหล่านี้ แล้วเปรียบเทียบ shape ของมันกับ bow_matrix ที่ได้จากแบบฝึกหัดก่อนหน้า แท็กไลน์ที่ผ่านการทำ lemmatization 5 รายการแรกใน lem_corpus ได้ถูกพิมพ์ไว้ใน console ให้ตรวจสอบแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Feature Engineering for NLP in Python
คำแนะนำการฝึกหัด
- Import คลาส
CountVectorizerจากsklearn - สร้าง object
CountVectorizerและตั้งชื่อว่าvectorizer - ใช้
fit_transform()เพื่อสร้างbow_lem_matrixจากlem_corpus
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create CountVectorizer object
____ = ____
# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)
# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)