เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

นับคำ (I)

เมื่อบันทึกข้อมูลในระดับภาพรวมแล้ว ก็สามารถเริ่มสร้าง feature จากเนื้อหาจริงของแต่ละข้อความได้ วิธีหนึ่งคือใช้แนวทางคล้ายกับที่เคยทำกับตัวแปรประเภท categorical ในบทก่อน

  • สร้างคอลัมน์หนึ่งคอลัมน์สำหรับแต่ละคำที่ไม่ซ้ำกันในชุดข้อมูล
  • สำหรับแต่ละรายการ จะนับจำนวนครั้งที่คำนั้นปรากฏและบันทึกค่าลงในคอลัมน์ที่เกี่ยวข้อง

คอลัมน์ "count" เหล่านี้สามารถนำไปใช้เทรนโมเดล machine learning ได้

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Feature Engineering สำหรับ Machine Learning ใน Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • Import CountVectorizer จาก sklearn.feature_extraction.text
  • สร้าง instance ของ CountVectorizer และกำหนดให้กับตัวแปร cv
  • Fit vectorizer กับคอลัมน์ text_clean
  • แสดงชื่อ feature ที่ vectorizer สร้างขึ้น

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import CountVectorizer
____

# Instantiate CountVectorizer
cv = ____

# Fit the vectorizer
cv.____(speech_df['text_clean'])

# Print feature names
print(cv.____)
แก้ไขและรันโค้ด