Tokenizace vět pomocí Keras
V tomto cvičení si vyzkoušíš práci s Keras Tokenizerem. Keras Tokenizer je skvělý nástroj, který ti umožní provádět klíčové zpracování textu jen s pár řádky kódu. Například Keras Tokenizer automaticky přiřadí slovům ve tvém slovníku odpovídající ID jediným voláním funkce. Tady se o tom dozvíš víc.
Vytvoříš objekt Keras Tokenizer a natrénuješ ho na textu, čímž Tokenizeru umožníš sestavit slovník slov a jejich příslušných ID. Text použitý k trénování Tokenizeru pochází z Udacity Github Repo.
Toto cvičení je součástí kurzu
Machine Translation with Keras
Pokyny k cvičení
- Definuj objekt Keras Tokenizer.
- Natrénuj tokenizér na
en_text. - Získej ID slova pro každé slovo
wz daného seznamu["january", "apples", "summer"]. - Vypiš slovo a jeho příslušné ID.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
from tensorflow.keras.preprocessing.text import Tokenizer
# Define a Keras Tokenizer
en_tok = ____
# Fit the tokenizer on some text
en_tok.____(____)
for w in ["january", "apples", "summer"]:
# Get the word ID of word w
id = en_tok.____[____]
# Print the word and the word ID
print(____, " has id: ", _____)