Bắt đầu ngayBắt đầu miễn phí

Sử dụng n-gram dài hơn

Đến giờ bạn đã tạo đặc trưng dựa trên từng từ riêng lẻ trong mỗi văn bản. Cách này có thể rất hiệu quả khi dùng trong mô hình Machine Learning, nhưng bạn có thể lo rằng việc xem xét từng từ sẽ bỏ qua nhiều ngữ cảnh. Để xử lý điều này khi xây dựng mô hình, bạn có thể dùng n-gram, tức là chuỗi gồm n từ liên tiếp được nhóm lại. Ví dụ:

  • bigram: Chuỗi gồm hai từ liên tiếp
  • trigram: Chuỗi gồm ba từ liên tiếp

Bạn có thể tự động tạo các đặc trưng này trong dữ liệu bằng cách chỉ định đối số ngram_range là một tuple (n1, n2), trong đó tất cả n-gram trong khoảng từ n1 đến n2 sẽ được đưa vào.

Bài tập này là một phần của khóa học

Feature Engineering cho Machine Learning bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Import CountVectorizer từ sklearn.feature_extraction.text.
  • Khởi tạo CountVectorizer chỉ xét các trigram.
  • Fit và áp dụng vectorizer lên cột text_clean trong một bước.
  • In ra các tên đặc trưng do vectorizer tạo ra.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Instantiate a trigram vectorizer
cv_trigram_vec = CountVectorizer(max_features=100, 
                                 stop_words='english', 
                                 ____)

# Fit and apply trigram vectorizer
cv_trigram = ____(speech_df['text_clean'])

# Print the trigram features
print(cv_trigram_vec.____)
Chỉnh sửa và Chạy Mã