เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ฟีเจอร์ระดับสูงจากข้อความ

เมื่อทำความสะอาดและปรับมาตรฐานข้อความแล้ว ก็สามารถเริ่มสร้างฟีเจอร์จากข้อมูลได้ ข้อมูลพื้นฐานที่สุดที่คำนวณได้จากข้อความอิสระคือขนาดของข้อความ เช่น ความยาวและจำนวนคำ ในแบบฝึกหัดนี้ (และแบบฝึกหัดที่เหลือในบทนี้) จะใช้คอลัมน์ข้อความที่ผ่านการทำความสะอาดแล้ว (text_clean) ซึ่งสร้างไว้ในแบบฝึกหัดที่แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Feature Engineering สำหรับ Machine Learning ใน Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • บันทึกความยาวของตัวอักษรในแต่ละสุนทรพจน์ลงในคอลัมน์ char_count
  • บันทึกจำนวนคำในแต่ละสุนทรพจน์ลงในคอลัมน์ word_count
  • บันทึกความยาวเฉลี่ยของคำในแต่ละสุนทรพจน์ลงในคอลัมน์ avg_word_length

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Find the length of each text
speech_df['char_cnt'] = speech_df['text_clean'].____

# Count the number of words in each text
speech_df['word_cnt'] = speech_df['text_clean'].____

# Find the average length of word
speech_df['avg_word_length'] = ____ / ____

# Print the first 5 rows of these columns
print(speech_df[['text_clean', 'char_cnt', 'word_cnt', 'avg_word_length']])
แก้ไขและรันโค้ด