Tokenizacja zdań w Keras
W tym ćwiczeniu poznasz w praktyce obiekt Tokenizer z biblioteki Keras. To bardzo przydatne narzędzie, które pozwala wykonać kluczowe operacje na tekście zaledwie kilkoma liniami kodu. Na przykład Tokenizer automatycznie przypisuje słowom ze słownika odpowiadające im identyfikatory – wystarczy jedno wywołanie funkcji. Tutaj przyjrzysz się temu mechanizmowi dokładniej.
Utworzysz obiekt Tokenizer i dopasujesz go do przykładowego tekstu. Dzięki temu Tokenizer zbuduje słownik słów wraz z odpowiadającymi im identyfikatorami. Tekst użyty do trenowania Tokenizera pochodzi z repozytorium Udacity na GitHubie.
To ćwiczenie jest częścią kursu
Tłumaczenie maszynowe z Keras
Instrukcje do ćwiczenia
- Zdefiniuj obiekt
Tokenizerz biblioteki Keras. - Dopasuj tokenizer do danych
en_text. - Pobierz identyfikator każdego słowa
wz podanej listy["january", "apples", "summer"]. - Wypisz słowo oraz jego odpowiadający identyfikator.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
from tensorflow.keras.preprocessing.text import Tokenizer
# Define a Keras Tokenizer
en_tok = ____
# Fit the tokenizer on some text
en_tok.____(____)
for w in ["january", "apples", "summer"]:
# Get the word ID of word w
id = en_tok.____[____]
# Print the word and the word ID
print(____, " has id: ", _____)