ขนาดของ Vocabulary จากรีวิวภาพยนตร์
ในแบบฝึกหัดนี้ คุณจะได้ฝึกวิธีต่าง ๆ ในการจำกัดขนาดของ vocabulary โดยใช้ตัวอย่างจากชุดข้อมูลรีวิว movies คอลัมน์แรกคือ review ซึ่งมีประเภทเป็น object และคอลัมน์ที่สองคือ label โดย 0 หมายถึงรีวิวเชิงลบ และ 1 หมายถึงรีวิวเชิงบวก
ทั้งสามวิธีที่จะใช้จะแปลงคอลัมน์ข้อความให้เป็นคอลัมน์ตัวเลขใหม่ โดยนับจำนวนครั้งที่คำหรือวลีปรากฏในแต่ละรีวิว แต่ละวิธีจะให้จำนวน feature ใหม่ที่แตกต่างกัน
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Sentiment Analysis ด้วย Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify size of vocabulary and fit
vect = CountVectorizer(____=____)
vect.fit(movies.review)
# Transform the review column
X_review = vect.transform(movies.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())