Tokenizzazione delle frasi con Keras
Qui metterai le mani in pasta con il Tokenizer di Keras. Il Tokenizer di Keras è un'ottima utility che ti permette di eseguire alcune operazioni fondamentali di elaborazione del testo con poche righe di codice. Ad esempio, il Tokenizer di Keras mappa automaticamente le parole del tuo vocabolario in ID con una singola chiamata di funzione. Qui vedrai questo processo più nel dettaglio.
Creerai un oggetto Tokenizer di Keras e lo addestrerai su del testo, così il Tokenizer potrà costruire un dizionario di parole e dei relativi ID. Il testo usato per addestrare il Tokenizer è ottenuto dalla Udacity Github Repo.
Questo esercizio fa parte del corso
Traduzione automatica con Keras
Istruzioni dell'esercizio
- Definisci un oggetto Tokenizer di Keras.
- Addestra il tokenizer su
en_text. - Ottieni l'ID della parola per ciascuna parola
wnella lista["january", "apples", "summer"]. - Stampa la parola e il suo ID corrispondente.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
from tensorflow.keras.preprocessing.text import Tokenizer
# Define a Keras Tokenizer
en_tok = ____
# Fit the tokenizer on some text
en_tok.____(____)
for w in ["january", "apples", "summer"]:
# Get the word ID of word w
id = en_tok.____[____]
# Print the word and the word ID
print(____, " has id: ", _____)