Omvandla ny text
I den här övningen omvandlar du en ny text till sekvenser av numeriska index baserade på de dictionaries som skapades tidigare.
Detta är användbart när du redan har en tränad modell och vill tillämpa den på ett nytt dataset. Förbehandlingsstegen som utfördes på träningsdatan bör även tillämpas på den nya texten, så att modellen kan göra förutsägelser och klassificeringar.
Här används även en speciell token '<UKN/>' för att representera ord som inte finns i vokabulären. Sådana specialtokens tilldelas vanligtvis de första indexen i dictionarierna, det vill säga position 0.
Variablerna word_to_index, index_to_word och vocabulary är redan inlästa i miljön. Det är även variabeln med den nya texten, som är inläst som new_text. Den nya texten har skrivits ut så att du kan ta en titt på den.
Den här övningen är en del av kursen
Återkommande neurala nätverk (RNN) för språkmodellering med Keras
Övningsinstruktioner
- Loopa igenom listan
new_textsom innehåller meningarna. - Sätt index till
0om ordet inte hittas i dictionaryn. - Lägg till meningen med index i variabeln
new_text_split. - Konvertera indexen tillbaka till text med hjälp av dictionaryn
index_to_word.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Loop through the sentences and get indexes
new_text_split = []
for sentence in ____:
sent_split = []
for wd in sentence.split(' '):
index = word_to_index.get(wd, ____)
sent_split.append(index)
new_text_split.append(____)
# Print the first sentence's indexes
print(new_text_split[0])
# Print the sentence converted using the dictionary
print(' '.join([index_to_word[____] for index in new_text_split[0]]))