Перетворення нового тексту
У цій вправі ви перетворите новий текст на послідовності числових індексів за словниками, створеними раніше.
Це корисно, коли у вас уже є натренована модель і ви хочете застосувати її до нового набору даних. Кроки передопрацювання, виконані для тренувальних даних, слід застосувати й до нового тексту, щоб модель могла робити передбачення/класифікацію.
Тут ви також використаєте спеціальний токен '<UKN/>' для слів, яких немає в словнику. Зазвичай такі спеціальні токени мають перші індекси у словниках, позиція 0.
Змінні word_to_index, index_to_word і vocabulary уже завантажено в середовище. Також змінну з новим текстом завантажено як new_text. Новий текст уже виведено на друк, щоб ви могли його переглянути.
Ця вправа є частиною курсу
Recurrent Neural Networks (RNNs) для моделювання мови з Keras
Інструкції до вправи
- Пройдіться циклом по списку
new_text, що містить речення. - Встановіть
0як індекс, якщо слово не знайдено в словнику. - Додайте речення з індексами до змінної
new_text_split. - Перетворіть індекси назад у текст за допомогою словника
index_to_word.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Loop through the sentences and get indexes
new_text_split = []
for sentence in ____:
sent_split = []
for wd in sentence.split(' '):
index = word_to_index.get(wd, ____)
sent_split.append(index)
new_text_split.append(____)
# Print the first sentence's indexes
print(new_text_split[0])
# Print the sentence converted using the dictionary
print(' '.join([index_to_word[____] for index in new_text_split[0]]))