เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

จำนวนคำในการบรรยาย TED

ted คือ DataFrame ที่เก็บบทถอดความของการบรรยาย TED จำนวน 500 รายการ งานของคุณคือสร้างฟีเจอร์ใหม่ชื่อ word_count ซึ่งเก็บจำนวนคำโดยประมาณของแต่ละการบรรยาย จากนั้นคำนวณจำนวนคำเฉลี่ยของการบรรยายทั้งหมด โดยบทถอดความจะอยู่ในฟีเจอร์ transcript ของ ted

เพื่อทำงานนี้ให้สำเร็จ ต้องกำหนดฟังก์ชัน count_words ที่รับ string เป็นอาร์กิวเมนต์และคืนค่าจำนวนคำในสตริงนั้น จากนั้นนำฟังก์ชันนี้ไปใช้กับคอลัมน์ transcript ของ ted เพื่อสร้างฟีเจอร์ word_count และคำนวณค่าเฉลี่ย

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Feature Engineering for NLP in Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • แยก string ออกเป็นลิสต์ของคำโดยใช้เมธอด split()
  • คืนค่าจำนวนสมาชิกใน words โดยใช้ len()
  • นำฟังก์ชันที่สร้างไปใช้กับคอลัมน์ transcript ของ ted เพื่อสร้างฟีเจอร์ word_count
  • คำนวณจำนวนคำเฉลี่ยของการบรรยายโดยใช้ mean()

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Function that returns number of words in a string
def count_words(string):
	# Split the string into words
    words = ____.____
    
    # Return the number of words
    return ____(____)

# Create a new feature word_count
ted['word_count'] = ted[____].apply(____)

# Print the average word count of the talks
print(ted[____].____)
แก้ไขและรันโค้ด