การแมปดัชนีฟีเจอร์กับชื่อฟีเจอร์
ในวิดีโอบทเรียน เราได้เห็นแล้วว่า CountVectorizer ไม่ได้จัดเรียงคำศัพท์ตามลำดับตัวอักษรเสมอไป ในแบบฝึกหัดนี้ เราจะเรียนรู้วิธีแมปดัชนีฟีเจอร์แต่ละตัวกับชื่อฟีเจอร์ที่ตรงกันในคำศัพท์
เราจะใช้ประโยคสามประโยคเกี่ยวกับสิงโตชุดเดิมจากวิดีโอ ประโยคเหล่านี้ถูกเก็บไว้ในลิสต์ชื่อ corpus และแสดงผลไว้ในคอนโซลแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Feature Engineering for NLP in Python
คำแนะนำการฝึกหัด
- สร้างออบเจกต์
CountVectorizerและตั้งชื่อว่าvectorizer - ใช้
fit_transform()เพื่อสร้างbow_matrixสำหรับcorpus - ใช้เมธอด
get_feature_names()เพื่อแมปชื่อคอลัมน์กับคำที่ตรงกันในคำศัพท์
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create CountVectorizer object
vectorizer = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())
# Map the column names to vocabulary
bow_df.columns = vectorizer.____
# Print bow_df
print(bow_df)