Zacznij terazZacznij za darmo

Przekształcanie nowego tekstu

W tym ćwiczeniu przekształcisz nowy tekst w sekwencje indeksów liczbowych na podstawie wcześniej utworzonych słowników.

To przydatne, gdy masz już wytrenowany model i chcesz zastosować go na nowym zbiorze danych. Kroki przetwarzania wstępnego wykonane na danych treningowych powinny być również zastosowane do nowego tekstu, aby model mógł dokonywać predykcji i klasyfikacji.

W tym ćwiczeniu użyjesz też specjalnego tokenu '<UKN/>' do reprezentowania słów spoza słownictwa modelu. Zazwyczaj takie specjalne tokeny zajmują pierwsze indeksy słowników, czyli pozycję 0.

Zmienne word_to_index, index_to_word oraz vocabulary są już załadowane w środowisku. Załadowana jest również zmienna z nowym tekstem – new_text. Nowy tekst został wyświetlony, abyś mógł się z nim zapoznać.

To ćwiczenie jest częścią kursu

Rekurencyjne sieci neuronowe (RNN) do modelowania języka w Keras

Zobacz kurs

Instrukcje do ćwiczenia

  • Przejdź w pętli przez listę new_text zawierającą zdania.
  • Ustaw indeks na 0, jeśli dane słowo nie zostanie znalezione w słowniku.
  • Dołącz zdanie z indeksami do zmiennej new_text_split.
  • Przekształć indeksy z powrotem na tekst, korzystając ze słownika index_to_word.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Loop through the sentences and get indexes
new_text_split = []
for sentence in ____:
    sent_split = []
    for wd in sentence.split(' '):
        index = word_to_index.get(wd, ____)
        sent_split.append(index)
    new_text_split.append(____)

# Print the first sentence's indexes
print(new_text_split[0])

# Print the sentence converted using the dictionary
print(' '.join([index_to_word[____] for index in new_text_split[0]]))
Edytuj i uruchom kod