เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

กำหนดความยาวลำดับ token ด้วย BOW

จากที่เห็นในวิดีโอ การกำหนดความยาวของ token ที่แตกต่างกัน ซึ่งเรียกว่า n-grams ช่วยให้เราเข้าใจบริบทได้ดีขึ้น ซึ่งเป็นสิ่งสำคัญมาก

ในแบบฝึกหัดนี้ จะได้ทำงานกับตัวอย่างรีวิวสินค้าจาก Amazon โดยมีหน้าที่สร้าง vocabulary แบบ BOW โดยใช้คอลัมน์ review และกำหนดความยาวของลำดับ token

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Sentiment Analysis ด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้าง vectorizer โดยกำหนดความยาวลำดับ token เป็น uni-gram และ bigram
  • Fit vectorizer
  • Transform vectorizer ที่ fit แล้ว
  • ใน DataFrame ให้ระบุชื่อคอลัมน์ให้ถูกต้อง

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)

# Transform the review column
X_review = vect.____(reviews.review)

# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())
แก้ไขและรันโค้ด