Začněte nyníZačněte zdarma

Tokenizace vět pomocí Keras

V tomto cvičení si vyzkoušíš práci s Keras Tokenizerem. Keras Tokenizer je skvělý nástroj, který ti umožní provádět klíčové zpracování textu jen s pár řádky kódu. Například Keras Tokenizer automaticky přiřadí slovům ve tvém slovníku odpovídající ID jediným voláním funkce. Tady se o tom dozvíš víc.

Vytvoříš objekt Keras Tokenizer a natrénuješ ho na textu, čímž Tokenizeru umožníš sestavit slovník slov a jejich příslušných ID. Text použitý k trénování Tokenizeru pochází z Udacity Github Repo.

Toto cvičení je součástí kurzu

Machine Translation with Keras

Zobrazit kurz

Pokyny k cvičení

  • Definuj objekt Keras Tokenizer.
  • Natrénuj tokenizér na en_text.
  • Získej ID slova pro každé slovo w z daného seznamu ["january", "apples", "summer"].
  • Vypiš slovo a jeho příslušné ID.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

from tensorflow.keras.preprocessing.text import Tokenizer

# Define a Keras Tokenizer
en_tok = ____

# Fit the tokenizer on some text
en_tok.____(____)

for w in ["january", "apples", "summer"]:
  # Get the word ID of word w
  id = en_tok.____[____]
  # Print the word and the word ID
  print(____, " has id: ", _____)
Upravit a spustit kód