Transformer un nouveau texte
Dans cet exercice, vous allez transformer un nouveau texte en séquences d'indices numériques à partir des dictionnaires créés plus tôt.
C'est utile lorsque vous avez déjà un modèle entraîné et que vous voulez l'appliquer à un nouveau jeu de données. Les étapes de prétraitement effectuées sur les données d'entraînement doivent aussi être appliquées au nouveau texte, afin que le modèle puisse faire des prédictions/classifications.
Ici, vous utiliserez aussi un jeton spécial '<UKN/>' pour représenter les mots qui ne sont pas dans le vocabulaire. En général, ces jetons spéciaux occupent les premiers indices des dictionnaires, à la position 0.
Les variables word_to_index, index_to_word et vocabulary sont déjà chargées dans l'environnement. De plus, la variable contenant le nouveau texte est chargée sous le nom new_text. Le nouveau texte a été affiché pour que vous puissiez y jeter un coup d'œil.
Cette activité fait partie du cours
Réseaux de neurones récurrents (RNN) pour la modélisation du langage avec Keras
Instructions de l’exercice
- Parcourez la liste
new_textqui contient les phrases. - Attribuez l'indice
0si le mot n'est pas trouvé dans le dictionnaire. - Ajoutez la phrase convertie en indices à la variable
new_text_split. - Convertissez les indices en texte à l'aide du dictionnaire
index_to_word.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Loop through the sentences and get indexes
new_text_split = []
for sentence in ____:
sent_split = []
for wd in sentence.split(' '):
index = word_to_index.get(wd, ____)
sent_split.append(index)
new_text_split.append(____)
# Print the first sentence's indexes
print(new_text_split[0])
# Print the sentence converted using the dictionary
print(' '.join([index_to_word[____] for index in new_text_split[0]]))