เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การวิเคราะห์ความรู้สึกด้วย GBM

ลองใช้ GradientBoostingClassifier ของ scikit-learn กับชุดข้อมูล reviews เพื่อพยากรณ์ความรู้สึก (sentiment) ของรีวิวจากข้อความ

เราจะไม่ป้อนข้อความดิบเข้าโมเดลโดยตรง แต่มีการเตรียมข้อมูลล่วงหน้าให้แล้วดังนี้:

  1. ลบรีวิวที่มีค่าว่างออก
  2. คัดเลือกข้อมูลจาก 5 แอปยอดนิยม
  3. สุ่มตัวอย่างรีวิวจำนวน 500 รายการ
  4. ลบ "stop words" ออกจากรีวิว
  5. แปลงรีวิวให้เป็นเมทริกซ์ โดยแต่ละฟีเจอร์แทนความถี่ของคำในรีวิวนั้น

อยากเข้าใจ text mining ให้ลึกยิ่งขึ้นหรือเปล่า? ไปดูคอร์ส Introduction to Natural Language Processing in Python ได้เลย!

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Ensemble Methods ใน Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้าง GradientBoostingClassifier ที่มี 100 estimators และ learning rate เท่ากับ 0.1
  • คำนวณค่าพยากรณ์บนชุดทดสอบ
  • คำนวณค่าความแม่นยำเพื่อประเมินโมเดล
  • คำนวณและแสดง confusion matrix

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Build and fit a Gradient Boosting classifier
clf_gbm = ____(____, ____, random_state=500)
clf_gbm.fit(X_train, y_train)

# Calculate the predictions on the test set
pred = ____

# Evaluate the performance based on the accuracy
acc = ____
print('Accuracy: {:.3f}'.format(acc))

# Get and show the Confusion Matrix
cm = ____
print(cm)
แก้ไขและรันโค้ด