กำหนดความยาวลำดับ token ด้วย BOW
จากที่เห็นในวิดีโอ การกำหนดความยาวของ token ที่แตกต่างกัน ซึ่งเรียกว่า n-grams ช่วยให้เราเข้าใจบริบทได้ดีขึ้น ซึ่งเป็นสิ่งสำคัญมาก
ในแบบฝึกหัดนี้ จะได้ทำงานกับตัวอย่างรีวิวสินค้าจาก Amazon โดยมีหน้าที่สร้าง vocabulary แบบ BOW โดยใช้คอลัมน์ review และกำหนดความยาวของลำดับ token
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Sentiment Analysis ด้วย Python
คำแนะนำการฝึกหัด
- สร้าง vectorizer โดยกำหนดความยาวลำดับ token เป็น uni-gram และ bigram
- Fit vectorizer
- Transform vectorizer ที่ fit แล้ว
- ใน DataFrame ให้ระบุชื่อคอลัมน์ให้ถูกต้อง
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)
# Transform the review column
X_review = vect.____(reviews.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())