ÎncepețiÎncepe gratuit

Partea 1: Explorarea setului de date

Acum vei explora puțin setul de date. Mai întâi vei face cunoștință cu structura datelor: vei afișa câteva exemple și vei învăța cum să tokenizezi propozițiile în cuvinte individuale. În cazul limbii engleze, tokenizarea pare o sarcină simplă; există însă limbi, cum ar fi japoneza, care nu au delimitatori la fel de consecvenți ca engleza.

Pentru acest exercițiu, ai la dispoziție două seturi de date: en_text și fr_text. en_text conține o listă de propoziții în engleză, iar fr_text conține lista corespunzătoare de propoziții în franceză.

Acest exercițiu face parte din cursul

Traducere automată cu Keras

Vezi cursul

Instrucțiuni pentru exercițiu

  • Scrie o funcție zip() care iterează prin primele 5 propoziții din propozițiile în engleză (en_text) și din cele în franceză (fr_text).
  • Extrage prima propoziție în engleză din en_text.
  • Tokenizează propoziția obținută folosind funcția split() și caracterul spațiu, apoi atribuie rezultatul variabilei first_words.
  • Afișează cuvintele tokenizate.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Iterate through the first 5 English and French sentences in the dataset
for en_sent, fr_sent in zip(____, ____):  
  print("English: ", en_sent)
  print("\tFrench: ", fr_sent)

# Get the first sentence of the English dataset
first_sent = ____[____]
print("First sentence: ", first_sent)
# Tokenize the first sentence
____ = ____.____(____)
# Print the tokenized words
print("\tWords: ", ____)
Editează și rulează codul