Transformace nového textu
V tomto cvičení převedeš nový text na sekvence číselných indexů pomocí slovníků, které jsi vytvořil/a dříve.
To se hodí ve chvíli, kdy už máš natrénovaný model a chceš ho použít na nové datové sadě. Kroky předzpracování provedené na trénovacích datech je nutné aplikovat i na nový text, aby model mohl provádět predikce nebo klasifikaci.
Použiješ také speciální token '<UKN/>', který zastupuje slova, jež nejsou ve slovníku. Tyto speciální tokeny mívají zpravidla první indexy ve slovnících, tedy pozici 0.
Proměnné word_to_index, index_to_word a vocabulary jsou v prostředí již načteny. Stejně tak je načtena proměnná s novým textem jako new_text. Nový text je pro přehled rovnou vypsán.
Toto cvičení je součástí kurzu
Rekurentní neuronové sítě (RNN) pro jazykové modelování s Keras
Pokyny k cvičení
- Projdi seznam
new_textobsahující věty. - Nastav index na
0pro případ, že slovo není ve slovníku nalezeno. - Přidej větu s indexy do proměnné
new_text_split. - Převeď indexy zpět na text pomocí slovníku
index_to_word.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Loop through the sentences and get indexes
new_text_split = []
for sentence in ____:
sent_split = []
for wd in sentence.split(' '):
index = word_to_index.get(wd, ____)
sent_split.append(index)
new_text_split.append(____)
# Print the first sentence's indexes
print(new_text_split[0])
# Print the sentence converted using the dictionary
print(' '.join([index_to_word[____] for index in new_text_split[0]]))