Del 1: Utforska datamängden
Nu ska du utforska datamängden lite närmare. Du får en känsla för hur datan ser ut, skriver ut några exempel och lär dig att tokenisera meningar till enskilda ord. För engelska verkar tokenisering vara en enkel uppgift, men det finns språk som japanska där ord inte avgränsas lika konsekvent.
I den här övningen har du tillgång till två datamängder: en_text och fr_text. en_text innehåller en lista med engelska meningar och fr_text innehåller motsvarande lista med franska meningar.
Den här övningen är en del av kursen
Maskinöversättning med Keras
Övningsinstruktioner
- Skriv en
zip()-funktion som itererar genom de första 5 meningarna i den engelska (en_text) och franska (fr_text) datamängden. - Hämta den första engelska meningen från
en_text. - Tokenisera den hämtade meningen med funktionen
split()och mellanslagstecknet, och tilldela resultatet tillfirst_words. - Skriv ut de tokeniserade orden.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Iterate through the first 5 English and French sentences in the dataset
for en_sent, fr_sent in zip(____, ____):
print("English: ", en_sent)
print("\tFrench: ", fr_sent)
# Get the first sentence of the English dataset
first_sent = ____[____]
print("First sentence: ", first_sent)
# Tokenize the first sentence
____ = ____.____(____)
# Print the tokenized words
print("\tWords: ", ____)