Transformarea unui text nou
În acest exercițiu, vei transforma un text nou în secvențe de indecși numerici, folosind dicționarele create anterior.
Acest lucru este util atunci când ai deja un model antrenat și vrei să îl aplici pe un set de date nou. Pașii de preprocesare aplicați datelor de antrenament trebuie aplicați și textului nou, astfel încât modelul să poată face predicții/clasificări.
Aici vei folosi și un token special '<UKN/>' pentru a reprezenta cuvintele care nu se află în vocabular. De obicei, aceste tokene speciale ocupă primii indecși din dicționare, adică poziția 0.
Variabilele word_to_index, index_to_word și vocabulary sunt deja încărcate în mediu. De asemenea, variabila cu textul nou este încărcată ca new_text. Textul nou a fost afișat pentru a-l putea consulta.
Acest exercițiu face parte din cursul
Rețele Neuronale Recurente (RNN) pentru Modelare a Limbajului cu Keras
Instrucțiuni pentru exercițiu
- Parcurge lista
new_textcare conține propozițiile. - Setează la
0indexul în cazul în care cuvântul nu este găsit în dicționar. - Adaugă propoziția cu indecși la variabila
new_text_split. - Convertește indecșii înapoi în text folosind dicționarul
index_to_word.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Loop through the sentences and get indexes
new_text_split = []
for sentence in ____:
sent_split = []
for wd in sentence.split(' '):
index = word_to_index.get(wd, ____)
sent_split.append(index)
new_text_split.append(____)
# Print the first sentence's indexes
print(new_text_split[0])
# Print the sentence converted using the dictionary
print(' '.join([index_to_word[____] for index in new_text_split[0]]))