เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ขนาดของ Vocabulary จากรีวิวภาพยนตร์

ในแบบฝึกหัดนี้ คุณจะได้ฝึกวิธีต่าง ๆ ในการจำกัดขนาดของ vocabulary โดยใช้ตัวอย่างจากชุดข้อมูลรีวิว movies คอลัมน์แรกคือ review ซึ่งมีประเภทเป็น object และคอลัมน์ที่สองคือ label โดย 0 หมายถึงรีวิวเชิงลบ และ 1 หมายถึงรีวิวเชิงบวก

ทั้งสามวิธีที่จะใช้จะแปลงคอลัมน์ข้อความให้เป็นคอลัมน์ตัวเลขใหม่ โดยนับจำนวนครั้งที่คำหรือวลีปรากฏในแต่ละรีวิว แต่ละวิธีจะให้จำนวน feature ใหม่ที่แตกต่างกัน

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Sentiment Analysis ด้วย Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify size of vocabulary and fit
vect = CountVectorizer(____=____)
vect.fit(movies.review)

# Transform the review column
X_review = vect.transform(movies.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())
แก้ไขและรันโค้ด