นับคำ (I)
เมื่อบันทึกข้อมูลในระดับภาพรวมแล้ว ก็สามารถเริ่มสร้าง feature จากเนื้อหาจริงของแต่ละข้อความได้ วิธีหนึ่งคือใช้แนวทางคล้ายกับที่เคยทำกับตัวแปรประเภท categorical ในบทก่อน
- สร้างคอลัมน์หนึ่งคอลัมน์สำหรับแต่ละคำที่ไม่ซ้ำกันในชุดข้อมูล
- สำหรับแต่ละรายการ จะนับจำนวนครั้งที่คำนั้นปรากฏและบันทึกค่าลงในคอลัมน์ที่เกี่ยวข้อง
คอลัมน์ "count" เหล่านี้สามารถนำไปใช้เทรนโมเดล machine learning ได้
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Feature Engineering สำหรับ Machine Learning ใน Python
คำแนะนำการฝึกหัด
- Import
CountVectorizerจากsklearn.feature_extraction.text - สร้าง instance ของ
CountVectorizerและกำหนดให้กับตัวแปรcv - Fit vectorizer กับคอลัมน์
text_clean - แสดงชื่อ feature ที่ vectorizer สร้างขึ้น
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import CountVectorizer
____
# Instantiate CountVectorizer
cv = ____
# Fit the vectorizer
cv.____(speech_df['text_clean'])
# Print feature names
print(cv.____)