จำนวนคำในการบรรยาย TED
ted คือ DataFrame ที่เก็บบทถอดความของการบรรยาย TED จำนวน 500 รายการ งานของคุณคือสร้างฟีเจอร์ใหม่ชื่อ word_count ซึ่งเก็บจำนวนคำโดยประมาณของแต่ละการบรรยาย จากนั้นคำนวณจำนวนคำเฉลี่ยของการบรรยายทั้งหมด โดยบทถอดความจะอยู่ในฟีเจอร์ transcript ของ ted
เพื่อทำงานนี้ให้สำเร็จ ต้องกำหนดฟังก์ชัน count_words ที่รับ string เป็นอาร์กิวเมนต์และคืนค่าจำนวนคำในสตริงนั้น จากนั้นนำฟังก์ชันนี้ไปใช้กับคอลัมน์ transcript ของ ted เพื่อสร้างฟีเจอร์ word_count และคำนวณค่าเฉลี่ย
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Feature Engineering for NLP in Python
คำแนะนำการฝึกหัด
- แยก
stringออกเป็นลิสต์ของคำโดยใช้เมธอดsplit() - คืนค่าจำนวนสมาชิกใน
wordsโดยใช้len() - นำฟังก์ชันที่สร้างไปใช้กับคอลัมน์
transcriptของtedเพื่อสร้างฟีเจอร์word_count - คำนวณจำนวนคำเฉลี่ยของการบรรยายโดยใช้
mean()
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Function that returns number of words in a string
def count_words(string):
# Split the string into words
words = ____.____
# Return the number of words
return ____(____)
# Create a new feature word_count
ted['word_count'] = ted[____].apply(____)
# Print the average word count of the talks
print(ted[____].____)