ÎncepețiÎncepe gratuit

Tokenizarea propozițiilor cu Keras

În acest exercițiu vei lucra direct cu obiectul Tokenizer din Keras. Acesta este un instrument extrem de util, care îți permite să realizezi procesări esențiale ale textului cu doar câteva linii de cod. De exemplu, Tokenizer-ul din Keras mapează automat cuvintele din vocabularul tău la ID-uri numerice printr-un singur apel de funcție. Vei explora acest mecanism în detaliu.

Vei crea un obiect Tokenizer din Keras și îl vei antrena pe un text, astfel încât acesta să construiască un dicționar de cuvinte și ID-urile corespunzătoare. Textul folosit pentru antrenarea Tokenizer-ului provine din Udacity Github Repo.

Acest exercițiu face parte din cursul

Traducere automată cu Keras

Vezi cursul

Instrucțiuni pentru exercițiu

  • Definește un obiect Tokenizer din Keras.
  • Antrenează tokenizatorul pe en_text.
  • Obține ID-ul fiecărui cuvânt w din lista dată ["january", "apples", "summer"].
  • Afișează cuvântul și ID-ul său corespunzător.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

from tensorflow.keras.preprocessing.text import Tokenizer

# Define a Keras Tokenizer
en_tok = ____

# Fit the tokenizer on some text
en_tok.____(____)

for w in ["january", "apples", "summer"]:
  # Get the word ID of word w
  id = en_tok.____[____]
  # Print the word and the word ID
  print(____, " has id: ", _____)
Editează și rulează codul