Đếm số từ trong các bài TED Talk
ted là một dataframe chứa bản chép lời của 500 TED Talk. Nhiệm vụ của bạn là tính một đặc trưng mới word_count thể hiện số từ xấp xỉ của mỗi bài nói. Sau đó, bạn cũng cần tính số từ trung bình của các bài nói. Bản chép lời có trong đặc trưng transcript của ted.
Để hoàn thành, bạn sẽ định nghĩa hàm count_words nhận một chuỗi làm tham số và trả về số từ trong chuỗi đó. Tiếp theo, áp dụng hàm này lên đặc trưng transcript của ted để tạo đặc trưng mới word_count và tính giá trị trung bình của nó.
Bài tập này là một phần của khóa học
Khai thác đặc trưng cho NLP bằng Python
Hướng dẫn bài tập
- Tách
stringthành danh sách các từ bằng phương thứcsplit(). - Trả về số phần tử trong
wordsbằnglen(). - Áp dụng hàm của bạn lên cột
transcriptcủatedđể tạo đặc trưng mớiword_count. - Tính số từ trung bình của các bài nói bằng
mean().
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Function that returns number of words in a string
def count_words(string):
# Split the string into words
words = ____.____
# Return the number of words
return ____(____)
# Create a new feature word_count
ted['word_count'] = ted[____].apply(____)
# Print the average word count of the talks
print(ted[____].____)