Bắt đầu ngayBắt đầu miễn phí

Ánh xạ chỉ số đặc trưng với tên đặc trưng

Trong video bài học, bạn đã thấy CountVectorizer không nhất thiết sắp xếp chỉ mục từ vựng theo thứ tự bảng chữ cái. Trong bài tập này, bạn sẽ học cách ánh xạ từng chỉ số đặc trưng với tên đặc trưng tương ứng trong từ vựng.

Chúng ta sẽ dùng lại ba câu về sư tử từ video. Các câu này có trong một danh sách tên là corpus và đã được in ra bảng điều khiển.

Bài tập này là một phần của khóa học

Khai thác đặc trưng cho NLP bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Khởi tạo một đối tượng CountVectorizer. Đặt tên là vectorizer.
  • Dùng fit_transform() để tạo bow_matrix cho corpus.
  • Dùng phương thức get_feature_names() để ánh xạ tên cột với từ tương ứng trong từ vựng.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Create CountVectorizer object
vectorizer = ____

# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)

# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())

# Map the column names to vocabulary 
bow_df.columns = vectorizer.____

# Print bow_df
print(bow_df)
Chỉnh sửa và Chạy Mã