Inizia subitoInizia gratis

Parte 1: Esplorare l'insieme di dati

Ora esplorerai un po' l'insieme di dati. Per prima cosa ti farai un'idea di come sono fatti i dati. Stamperai parte dei dati e imparerai a tokenizzare le frasi nei dati in singole parole. Per l'inglese, la tokenizzazione sembra un compito banale; tuttavia, esistono lingue come il giapponese che non sono delimitate in modo così coerente come l'inglese.

Per questo esercizio, hai a disposizione due insiemi di dati: en_text e fr_text. en_text contiene un elenco di frasi in inglese, mentre fr_text contiene il corrispondente elenco di frasi in francese.

Questo esercizio fa parte del corso

Traduzione automatica con Keras

Visualizza corso

Istruzioni dell'esercizio

  • Scrivi una funzione zip() che itera attraverso le prime 5 frasi delle frasi inglesi (en_text) e francesi (fr_text).
  • Ottieni la prima frase inglese da en_text.
  • Tokenizza la frase ottenuta usando la funzione split() e il carattere spazio e assegnala a first_words.
  • Stampa le parole tokenizzate.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Iterate through the first 5 English and French sentences in the dataset
for en_sent, fr_sent in zip(____, ____):  
  print("English: ", en_sent)
  print("\tFrench: ", fr_sent)

# Get the first sentence of the English dataset
first_sent = ____[____]
print("First sentence: ", first_sent)
# Tokenize the first sentence
____ = ____.____(____)
# Print the tokenized words
print("\tWords: ", ____)
Modifica ed esegui il codice