Tokenisering av meningar med Keras
Här får du öva praktiskt med Keras Tokenizer. Keras Tokenizer är ett kraftfullt verktyg som hjälper dig att utföra viktig textbearbetning med bara några få rader kod. Till exempel mappar Keras Tokenizer automatiskt orden i ditt vokabulär till ID:n med ett enda funktionsanrop. Här lär du dig mer om hur detta fungerar.
Du skapar ett Keras Tokenizer-objekt och tränar det på en text, vilket gör att Tokenizer kan bygga upp ett lexikon över ord och deras motsvarande ID:n. Texten som används för att träna Tokenizer hämtas från Udacity Github Repo.
Den här övningen är en del av kursen
Maskinöversättning med Keras
Övningsinstruktioner
- Definiera ett Keras Tokenizer-objekt.
- Träna tokenizern på
en_text. - Hämta ord-ID:t för varje ord
wi listan["january", "apples", "summer"]. - Skriv ut ordet och dess motsvarande ID.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
from tensorflow.keras.preprocessing.text import Tokenizer
# Define a Keras Tokenizer
en_tok = ____
# Fit the tokenizer on some text
en_tok.____(____)
for w in ["january", "apples", "summer"]:
# Get the word ID of word w
id = en_tok.____[____]
# Print the word and the word ID
print(____, " has id: ", _____)