BOW ด้วย n-grams และการจำกัดขนาด Vocabulary
ในแบบฝึกหัดนี้ จะได้ฝึกสร้าง bag-of-words อีกครั้งโดยใช้ชุดข้อมูล reviews ของรีวิวสินค้าจาก Amazon โดยงานหลักคือการจำกัดขนาด vocabulary และกำหนดความยาวของลำดับ token
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Sentiment Analysis ด้วย Python
คำแนะนำการฝึกหัด
- นำเข้า vectorizer จาก
sklearn - สร้าง vectorizer พร้อมระบุพารามิเตอร์ต่อไปนี้: จำกัดขนาด vocabulary ไว้ที่ 1,000 รายการ ใช้เฉพาะ bigrams และละเว้น term ที่ปรากฏในเอกสารมากกว่า 500 รายการ
- Fit vectorizer กับคอลัมน์
review - สร้าง DataFrame จากการแทนค่าแบบ BOW
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
#Import the vectorizer
from sklearn.____.____ import ____
# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)
# Transform the review
X_review = vect.transform(reviews.review)
# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())