Bắt đầu ngayBắt đầu miễn phí

Đặc trưng văn bản cấp cao

Khi văn bản đã được làm sạch và chuẩn hóa, bạn có thể bắt đầu tạo đặc trưng từ dữ liệu. Thông tin cơ bản nhất bạn có thể tính từ văn bản tự do là kích thước của nó, như độ dài và số lượng từ. Trong bài tập này (và phần còn lại của chương), bạn sẽ tập trung vào cột văn bản đã làm sạch/biến đổi (text_clean) mà bạn đã tạo ở bài trước.

Bài tập này là một phần của khóa học

Feature Engineering cho Machine Learning bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Ghi độ dài ký tự của mỗi bài diễn văn vào cột char_count.
  • Ghi số lượng từ của mỗi bài diễn văn vào cột word_count.
  • Ghi độ dài từ trung bình của mỗi bài diễn văn vào cột avg_word_length.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Find the length of each text
speech_df['char_cnt'] = speech_df['text_clean'].____

# Count the number of words in each text
speech_df['word_cnt'] = speech_df['text_clean'].____

# Find the average length of word
speech_df['avg_word_length'] = ____ / ____

# Print the first 5 rows of these columns
print(speech_df[['text_clean', 'char_cnt', 'word_cnt', 'avg_word_length']])
Chỉnh sửa và Chạy Mã