Biến đổi văn bản mới
Trong bài tập này, bạn sẽ biến đổi một văn bản mới thành các chuỗi chỉ số số học dựa trên các dictionary đã tạo trước đó.
Điều này hữu ích khi bạn đã có một mô hình được huấn luyện và muốn áp dụng nó lên một tập dữ liệu mới. Các bước tiền xử lý đã thực hiện trên dữ liệu huấn luyện cũng cần được áp dụng cho văn bản mới để mô hình có thể dự đoán/phân loại.
Tại đây, bạn cũng sẽ dùng token đặc biệt '<UKN/>' để biểu diễn những từ không có trong vocabulary. Thông thường, các token đặc biệt này sẽ nằm ở những chỉ số đầu tiên của dictionary, vị trí 0.
Các biến word_to_index, index_to_word và vocabulary đã được nạp sẵn trong môi trường. Ngoài ra, biến chứa văn bản mới cũng đã được nạp là new_text. Văn bản mới đã được in ra để bạn xem qua.
Bài tập này là một phần của khóa học
Mạng nơ-ron hồi quy (RNN) cho Mô hình ngôn ngữ với Keras
Hướng dẫn bài tập
- Lặp qua danh sách
new_textchứa các câu. - Gán chỉ số
0trong trường hợp không tìm thấy từ trong dictionary. - Thêm câu đã chuyển thành chỉ số vào biến
new_text_split. - Chuyển các chỉ số ngược lại thành văn bản bằng dictionary
index_to_word.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Loop through the sentences and get indexes
new_text_split = []
for sentence in ____:
sent_split = []
for wd in sentence.split(' '):
index = word_to_index.get(wd, ____)
sent_split.append(index)
new_text_split.append(____)
# Print the first sentence's indexes
print(new_text_split[0])
# Print the sentence converted using the dictionary
print(' '.join([index_to_word[____] for index in new_text_split[0]]))