Kom igångKom igång gratis

Del 1: Utforska datamängden

Nu ska du utforska datamängden lite närmare. Du får en känsla för hur datan ser ut, skriver ut några exempel och lär dig att tokenisera meningar till enskilda ord. För engelska verkar tokenisering vara en enkel uppgift, men det finns språk som japanska där ord inte avgränsas lika konsekvent.

I den här övningen har du tillgång till två datamängder: en_text och fr_text. en_text innehåller en lista med engelska meningar och fr_text innehåller motsvarande lista med franska meningar.

Den här övningen är en del av kursen

Maskinöversättning med Keras

Visa kurs

Övningsinstruktioner

  • Skriv en zip()-funktion som itererar genom de första 5 meningarna i den engelska (en_text) och franska (fr_text) datamängden.
  • Hämta den första engelska meningen från en_text.
  • Tokenisera den hämtade meningen med funktionen split() och mellanslagstecknet, och tilldela resultatet till first_words.
  • Skriv ut de tokeniserade orden.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Iterate through the first 5 English and French sentences in the dataset
for en_sent, fr_sent in zip(____, ____):  
  print("English: ", en_sent)
  print("\tFrench: ", fr_sent)

# Get the first sentence of the English dataset
first_sent = ____[____]
print("First sentence: ", first_sent)
# Tokenize the first sentence
____ = ____.____(____)
# Print the tokenized words
print("\tWords: ", ____)
Redigera och kör kod