Parte 1: Esplorare l'insieme di dati
Ora esplorerai un po' l'insieme di dati. Per prima cosa ti farai un'idea di come sono fatti i dati. Stamperai parte dei dati e imparerai a tokenizzare le frasi nei dati in singole parole. Per l'inglese, la tokenizzazione sembra un compito banale; tuttavia, esistono lingue come il giapponese che non sono delimitate in modo così coerente come l'inglese.
Per questo esercizio, hai a disposizione due insiemi di dati: en_text e fr_text. en_text contiene un elenco di frasi in inglese, mentre fr_text contiene il corrispondente elenco di frasi in francese.
Questo esercizio fa parte del corso
Traduzione automatica con Keras
Istruzioni dell'esercizio
- Scrivi una funzione
zip()che itera attraverso le prime 5 frasi delle frasi inglesi (en_text) e francesi (fr_text). - Ottieni la prima frase inglese da
en_text. - Tokenizza la frase ottenuta usando la funzione
split()e il carattere spazio e assegnala afirst_words. - Stampa le parole tokenizzate.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Iterate through the first 5 English and French sentences in the dataset
for en_sent, fr_sent in zip(____, ____):
print("English: ", en_sent)
print("\tFrench: ", fr_sent)
# Get the first sentence of the English dataset
first_sent = ____[____]
print("First sentence: ", first_sent)
# Tokenize the first sentence
____ = ____.____(____)
# Print the tokenized words
print("\tWords: ", ____)