เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

โมเดล BoW สำหรับ tagline ภาพยนตร์

ในแบบฝึกหัดนี้ มี corpus ที่รวบรวม tagline ภาพยนตร์มากกว่า 7,000 รายการไว้ให้แล้ว งานของคุณคือสร้างการแทนค่าแบบ bag of words เป็น bow_matrix สำหรับ tagline เหล่านี้ ในแบบฝึกหัดนี้จะข้ามขั้นตอนการประมวลผลข้อความ แล้วสร้าง bow_matrix โดยตรงเลย

นอกจากนี้ยังจะสำรวจ shape ของ bow_matrix ที่ได้ด้วย โดย tagline 5 รายการแรกใน corpus ถูกพิมพ์ออกมาที่คอนโซลให้ตรวจสอบแล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Feature Engineering for NLP in Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • Import คลาส CountVectorizer จาก sklearn
  • สร้างออบเจกต์ CountVectorizer แล้วตั้งชื่อว่า vectorizer
  • ใช้ fit_transform() เพื่อสร้าง bow_matrix จาก corpus

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create CountVectorizer object
____ = ____

# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)

# Print the shape of bow_matrix
print(bow_matrix.shape)
แก้ไขและรันโค้ด