Đếm số từ (I)
Sau khi đã ghi lại thông tin tổng quát, bạn có thể bắt đầu tạo đặc trưng dựa trên nội dung thực tế của từng văn bản. Một cách làm là tiếp cận tương tự như khi bạn xử lý biến phân loại ở các bài trước.
- Với mỗi từ duy nhất trong tập dữ liệu, sẽ tạo ra một cột.
- Với mỗi bản ghi, số lần từ đó xuất hiện được đếm và giá trị đếm được điền vào cột tương ứng.
Các cột "đếm" này sau đó có thể được dùng để huấn luyện các mô hình Machine Learning.
Bài tập này là một phần của khóa học
Feature Engineering cho Machine Learning bằng Python
Hướng dẫn bài tập
- Import
CountVectorizertừsklearn.feature_extraction.text. - Khởi tạo
CountVectorizervà gán vàocv. - Fit vectorizer với cột
text_clean. - In ra danh sách tên đặc trưng do vectorizer tạo ra.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import CountVectorizer
____
# Instantiate CountVectorizer
cv = ____
# Fit the vectorizer
cv.____(speech_df['text_clean'])
# Print feature names
print(cv.____)