Bắt đầu ngayBắt đầu miễn phí

Biến đổi văn bản mới

Trong bài tập này, bạn sẽ biến đổi một văn bản mới thành các chuỗi chỉ số số học dựa trên các dictionary đã tạo trước đó.

Điều này hữu ích khi bạn đã có một mô hình được huấn luyện và muốn áp dụng nó lên một tập dữ liệu mới. Các bước tiền xử lý đã thực hiện trên dữ liệu huấn luyện cũng cần được áp dụng cho văn bản mới để mô hình có thể dự đoán/phân loại.

Tại đây, bạn cũng sẽ dùng token đặc biệt '<UKN/>' để biểu diễn những từ không có trong vocabulary. Thông thường, các token đặc biệt này sẽ nằm ở những chỉ số đầu tiên của dictionary, vị trí 0.

Các biến word_to_index, index_to_wordvocabulary đã được nạp sẵn trong môi trường. Ngoài ra, biến chứa văn bản mới cũng đã được nạp là new_text. Văn bản mới đã được in ra để bạn xem qua.

Bài tập này là một phần của khóa học

Mạng nơ-ron hồi quy (RNN) cho Mô hình ngôn ngữ với Keras

Xem khóa học

Hướng dẫn bài tập

  • Lặp qua danh sách new_text chứa các câu.
  • Gán chỉ số 0 trong trường hợp không tìm thấy từ trong dictionary.
  • Thêm câu đã chuyển thành chỉ số vào biến new_text_split.
  • Chuyển các chỉ số ngược lại thành văn bản bằng dictionary index_to_word.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Loop through the sentences and get indexes
new_text_split = []
for sentence in ____:
    sent_split = []
    for wd in sentence.split(' '):
        index = word_to_index.get(wd, ____)
        sent_split.append(index)
    new_text_split.append(____)

# Print the first sentence's indexes
print(new_text_split[0])

# Print the sentence converted using the dictionary
print(' '.join([index_to_word[____] for index in new_text_split[0]]))
Chỉnh sửa và Chạy Mã