เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การแมปดัชนีฟีเจอร์กับชื่อฟีเจอร์

ในวิดีโอบทเรียน เราได้เห็นแล้วว่า CountVectorizer ไม่ได้จัดเรียงคำศัพท์ตามลำดับตัวอักษรเสมอไป ในแบบฝึกหัดนี้ เราจะเรียนรู้วิธีแมปดัชนีฟีเจอร์แต่ละตัวกับชื่อฟีเจอร์ที่ตรงกันในคำศัพท์

เราจะใช้ประโยคสามประโยคเกี่ยวกับสิงโตชุดเดิมจากวิดีโอ ประโยคเหล่านี้ถูกเก็บไว้ในลิสต์ชื่อ corpus และแสดงผลไว้ในคอนโซลแล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Feature Engineering for NLP in Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้างออบเจกต์ CountVectorizer และตั้งชื่อว่า vectorizer
  • ใช้ fit_transform() เพื่อสร้าง bow_matrix สำหรับ corpus
  • ใช้เมธอด get_feature_names() เพื่อแมปชื่อคอลัมน์กับคำที่ตรงกันในคำศัพท์

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create CountVectorizer object
vectorizer = ____

# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)

# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())

# Map the column names to vocabulary 
bow_df.columns = vectorizer.____

# Print bow_df
print(bow_df)
แก้ไขและรันโค้ด