Bắt đầu ngayBắt đầu miễn phí

Đếm số từ trong các bài TED Talk

ted là một dataframe chứa bản chép lời của 500 TED Talk. Nhiệm vụ của bạn là tính một đặc trưng mới word_count thể hiện số từ xấp xỉ của mỗi bài nói. Sau đó, bạn cũng cần tính số từ trung bình của các bài nói. Bản chép lời có trong đặc trưng transcript của ted.

Để hoàn thành, bạn sẽ định nghĩa hàm count_words nhận một chuỗi làm tham số và trả về số từ trong chuỗi đó. Tiếp theo, áp dụng hàm này lên đặc trưng transcript của ted để tạo đặc trưng mới word_count và tính giá trị trung bình của nó.

Bài tập này là một phần của khóa học

Khai thác đặc trưng cho NLP bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Tách string thành danh sách các từ bằng phương thức split().
  • Trả về số phần tử trong words bằng len().
  • Áp dụng hàm của bạn lên cột transcript của ted để tạo đặc trưng mới word_count.
  • Tính số từ trung bình của các bài nói bằng mean().

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Function that returns number of words in a string
def count_words(string):
	# Split the string into words
    words = ____.____
    
    # Return the number of words
    return ____(____)

# Create a new feature word_count
ted['word_count'] = ted[____].apply(____)

# Print the average word count of the talks
print(ted[____].____)
Chỉnh sửa và Chạy Mã