Ánh xạ chỉ số đặc trưng với tên đặc trưng
Trong video bài học, bạn đã thấy CountVectorizer không nhất thiết sắp xếp chỉ mục từ vựng theo thứ tự bảng chữ cái. Trong bài tập này, bạn sẽ học cách ánh xạ từng chỉ số đặc trưng với tên đặc trưng tương ứng trong từ vựng.
Chúng ta sẽ dùng lại ba câu về sư tử từ video. Các câu này có trong một danh sách tên là corpus và đã được in ra bảng điều khiển.
Bài tập này là một phần của khóa học
Khai thác đặc trưng cho NLP bằng Python
Hướng dẫn bài tập
- Khởi tạo một đối tượng
CountVectorizer. Đặt tên làvectorizer. - Dùng
fit_transform()để tạobow_matrixchocorpus. - Dùng phương thức
get_feature_names()để ánh xạ tên cột với từ tương ứng trong từ vựng.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create CountVectorizer object
vectorizer = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())
# Map the column names to vocabulary
bow_df.columns = vectorizer.____
# Print bow_df
print(bow_df)