ฟีเจอร์ระดับสูงจากข้อความ
เมื่อทำความสะอาดและปรับมาตรฐานข้อความแล้ว ก็สามารถเริ่มสร้างฟีเจอร์จากข้อมูลได้ ข้อมูลพื้นฐานที่สุดที่คำนวณได้จากข้อความอิสระคือขนาดของข้อความ เช่น ความยาวและจำนวนคำ ในแบบฝึกหัดนี้ (และแบบฝึกหัดที่เหลือในบทนี้) จะใช้คอลัมน์ข้อความที่ผ่านการทำความสะอาดแล้ว (text_clean) ซึ่งสร้างไว้ในแบบฝึกหัดที่แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Feature Engineering สำหรับ Machine Learning ใน Python
คำแนะนำการฝึกหัด
- บันทึกความยาวของตัวอักษรในแต่ละสุนทรพจน์ลงในคอลัมน์
char_count - บันทึกจำนวนคำในแต่ละสุนทรพจน์ลงในคอลัมน์
word_count - บันทึกความยาวเฉลี่ยของคำในแต่ละสุนทรพจน์ลงในคอลัมน์
avg_word_length
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Find the length of each text
speech_df['char_cnt'] = speech_df['text_clean'].____
# Count the number of words in each text
speech_df['word_cnt'] = speech_df['text_clean'].____
# Find the average length of word
speech_df['avg_word_length'] = ____ / ____
# Print the first 5 rows of these columns
print(speech_df[['text_clean', 'char_cnt', 'word_cnt', 'avg_word_length']])