เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

BOW ด้วย n-grams และการจำกัดขนาด Vocabulary

ในแบบฝึกหัดนี้ จะได้ฝึกสร้าง bag-of-words อีกครั้งโดยใช้ชุดข้อมูล reviews ของรีวิวสินค้าจาก Amazon โดยงานหลักคือการจำกัดขนาด vocabulary และกำหนดความยาวของลำดับ token

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Sentiment Analysis ด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • นำเข้า vectorizer จาก sklearn
  • สร้าง vectorizer พร้อมระบุพารามิเตอร์ต่อไปนี้: จำกัดขนาด vocabulary ไว้ที่ 1,000 รายการ ใช้เฉพาะ bigrams และละเว้น term ที่ปรากฏในเอกสารมากกว่า 500 รายการ
  • Fit vectorizer กับคอลัมน์ review
  • สร้าง DataFrame จากการแทนค่าแบบ BOW

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

#Import the vectorizer
from sklearn.____.____ import ____

# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)

# Transform the review
X_review = vect.transform(reviews.review)

# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())
แก้ไขและรันโค้ด