Vector từ trong vốn từ vựng của spaCy
Mục đích của vector từ là giúp máy tính "hiểu" các từ. Trong bài tập này, bạn sẽ luyện cách trích xuất vector từ cho một danh sách từ cho trước.
Một danh sách từ đã được tạo sẵn là words. Mô hình en_core_web_md đã được nhập và có sẵn dưới tên nlp.
Vốn từ vựng của mô hình en_core_web_md chứa 20.000 từ. Nếu một từ không tồn tại trong vốn từ vựng, bạn sẽ không thể trích xuất vector từ tương ứng của nó. Trong bài tập này, để đơn giản, đảm bảo rằng tất cả các từ đã cho đều có trong vốn từ vựng của mô hình này.
Bài tập này là một phần của khóa học
Xử lý ngôn ngữ tự nhiên với spaCy
Hướng dẫn bài tập
- Trích xuất các ID của toàn bộ
wordsđã cho và lưu vào danh sáchids. - Với mỗi ID trong
ids, lưu 10 phần tử đầu tiên của vector từ vào danh sáchword_vectors. - In ra 10 phần tử đầu tiên của vector từ đầu tiên trong
word_vectors.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
words = ["like", "love"]
# IDs of all the given words
ids = [nlp.____.____[w] for w in words]
# Store the first ten elements of the word vectors for each word
word_vectors = [nlp.____.____[i][:10] for i in ids]
# Print the first ten elements of the first word vector
print(____[0])