Partea 1: Explorarea setului de date
Acum vei explora puțin setul de date. Mai întâi vei face cunoștință cu structura datelor: vei afișa câteva exemple și vei învăța cum să tokenizezi propozițiile în cuvinte individuale. În cazul limbii engleze, tokenizarea pare o sarcină simplă; există însă limbi, cum ar fi japoneza, care nu au delimitatori la fel de consecvenți ca engleza.
Pentru acest exercițiu, ai la dispoziție două seturi de date: en_text și fr_text. en_text conține o listă de propoziții în engleză, iar fr_text conține lista corespunzătoare de propoziții în franceză.
Acest exercițiu face parte din cursul
Traducere automată cu Keras
Instrucțiuni pentru exercițiu
- Scrie o funcție
zip()care iterează prin primele 5 propoziții din propozițiile în engleză (en_text) și din cele în franceză (fr_text). - Extrage prima propoziție în engleză din
en_text. - Tokenizează propoziția obținută folosind funcția
split()și caracterul spațiu, apoi atribuie rezultatul variabileifirst_words. - Afișează cuvintele tokenizate.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Iterate through the first 5 English and French sentences in the dataset
for en_sent, fr_sent in zip(____, ____):
print("English: ", en_sent)
print("\tFrench: ", fr_sent)
# Get the first sentence of the English dataset
first_sent = ____[____]
print("First sentence: ", first_sent)
# Tokenize the first sentence
____ = ____.____(____)
# Print the tokenized words
print("\tWords: ", ____)