Inizia subitoInizia gratis

Tokenizzazione delle frasi con Keras

Qui metterai le mani in pasta con il Tokenizer di Keras. Il Tokenizer di Keras è un'ottima utility che ti permette di eseguire alcune operazioni fondamentali di elaborazione del testo con poche righe di codice. Ad esempio, il Tokenizer di Keras mappa automaticamente le parole del tuo vocabolario in ID con una singola chiamata di funzione. Qui vedrai questo processo più nel dettaglio.

Creerai un oggetto Tokenizer di Keras e lo addestrerai su del testo, così il Tokenizer potrà costruire un dizionario di parole e dei relativi ID. Il testo usato per addestrare il Tokenizer è ottenuto dalla Udacity Github Repo.

Questo esercizio fa parte del corso

Traduzione automatica con Keras

Visualizza corso

Istruzioni dell'esercizio

  • Definisci un oggetto Tokenizer di Keras.
  • Addestra il tokenizer su en_text.
  • Ottieni l'ID della parola per ciascuna parola w nella lista ["january", "apples", "summer"].
  • Stampa la parola e il suo ID corrispondente.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

from tensorflow.keras.preprocessing.text import Tokenizer

# Define a Keras Tokenizer
en_tok = ____

# Fit the tokenizer on some text
en_tok.____(____)

for w in ["january", "apples", "summer"]:
  # Get the word ID of word w
  id = en_tok.____[____]
  # Print the word and the word ID
  print(____, " has id: ", _____)
Modifica ed esegui il codice