เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

วิเคราะห์มิติข้อมูลและการประมวลผลล่วงหน้า

ในแบบฝึกหัดนี้ มี lem_corpus ให้แล้ว ซึ่งเก็บเวอร์ชันที่ผ่านการประมวลผลล่วงหน้าของแท็กไลน์ภาพยนตร์จากแบบฝึกหัดก่อนหน้า กล่าวคือ แท็กไลน์เหล่านั้นถูกแปลงเป็นตัวพิมพ์เล็ก ผ่านการทำ lemmatization และลบ stopwords ออกแล้ว

โจทย์คือสร้างการแทนค่าแบบ bag of words ชื่อ bow_lem_matrix จากแท็กไลน์ที่ผ่านการทำ lemmatization เหล่านี้ แล้วเปรียบเทียบ shape ของมันกับ bow_matrix ที่ได้จากแบบฝึกหัดก่อนหน้า แท็กไลน์ที่ผ่านการทำ lemmatization 5 รายการแรกใน lem_corpus ได้ถูกพิมพ์ไว้ใน console ให้ตรวจสอบแล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Feature Engineering for NLP in Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • Import คลาส CountVectorizer จาก sklearn
  • สร้าง object CountVectorizer และตั้งชื่อว่า vectorizer
  • ใช้ fit_transform() เพื่อสร้าง bow_lem_matrix จาก lem_corpus

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create CountVectorizer object
____ = ____

# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)

# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)
แก้ไขและรันโค้ด