Dodawanie tokenów specjalnych
Teraz nauczysz się dodawać tokeny sos (oznaczający początek) i eos (oznaczający koniec) do zdań. Jak już wspomniano, ten krok jest opcjonalny w przypadku modelu, z którym pracujesz teraz, ale będzie wymagany w modelu, który zaimplementujesz w późniejszym rozdziale.
Do dodawania tych tokenów specjalnych użyjesz funkcji string.join() z Pythona. Funkcja string.join() łączy listę ciągów znaków w jeden ciąg, używając określonego separatora. Na przykład, aby przekształcić ['datacamp', 'is', 'awesome'] w 'datacamp is awesome', możesz użyć " ".join(['datacamp', 'is', 'awesome']), gdzie " " (czyli znak spacji) jest separatorem.
Na potrzeby tego ćwiczenia zaimportowano już niewielką próbkę 10 zdań w języku francuskim.
To ćwiczenie jest częścią kursu
Tłumaczenie maszynowe z Keras
Instrukcje do ćwiczenia
- Przejdź pętlą przez listę zdań francuskich (
fr_text). - Dodaj token
"sos"oznaczający początek oraz token"eos"oznaczający koniec każdego zdania, używając funkcjistring.join(). - Dołącz zmodyfikowane zdanie do
fr_text_new. - Wyświetl zmodyfikowane zdanie
sent_new.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
fr_text_new = []
# Loop through all sentences in fr_text
for sent in ____:
print("Before adding tokens: ", sent)
# Add sos and eos tokens using string.join
sent_new = " ".____([____, sent, ____])
# Append the modified sentence to fr_text_new
____.____(____)
# Print sentence after adding tokens
print("After adding tokens: ", ____, '\n')