Đặc trưng văn bản cấp cao
Khi văn bản đã được làm sạch và chuẩn hóa, bạn có thể bắt đầu tạo đặc trưng từ dữ liệu. Thông tin cơ bản nhất bạn có thể tính từ văn bản tự do là kích thước của nó, như độ dài và số lượng từ. Trong bài tập này (và phần còn lại của chương), bạn sẽ tập trung vào cột văn bản đã làm sạch/biến đổi (text_clean) mà bạn đã tạo ở bài trước.
Bài tập này là một phần của khóa học
Feature Engineering cho Machine Learning bằng Python
Hướng dẫn bài tập
- Ghi độ dài ký tự của mỗi bài diễn văn vào cột
char_count. - Ghi số lượng từ của mỗi bài diễn văn vào cột
word_count. - Ghi độ dài từ trung bình của mỗi bài diễn văn vào cột
avg_word_length.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Find the length of each text
speech_df['char_cnt'] = speech_df['text_clean'].____
# Count the number of words in each text
speech_df['word_cnt'] = speech_df['text_clean'].____
# Find the average length of word
speech_df['avg_word_length'] = ____ / ____
# Print the first 5 rows of these columns
print(speech_df[['text_clean', 'char_cnt', 'word_cnt', 'avg_word_length']])