Część 1: Eksploracja zbioru danych
Teraz trochę przyjrzysz się zbiorowi danych. Na początku zorientujesz się, jak wyglądają dane. Wyświetlisz część z nich i nauczysz się, jak tokenizować zdania na poszczególne słowa. W przypadku języka angielskiego tokenizacja wydaje się prostym zadaniem – istnieją jednak języki, takie jak japoński, w których granice między słowami nie są tak wyraźne jak w angielskim.
W tym ćwiczeniu masz do dyspozycji dwa zbiory danych: en_text i fr_text. Zbiór en_text zawiera listę zdań w języku angielskim, a fr_text – odpowiadającą im listę zdań w języku francuskim.
To ćwiczenie jest częścią kursu
Tłumaczenie maszynowe z Keras
Instrukcje do ćwiczenia
- Napisz funkcję
zip(), która przejdzie przez pierwsze 5 zdań z angielskiego zbioru (en_text) i francuskiego zbioru (fr_text). - Pobierz pierwsze zdanie angielskie ze zbioru
en_text. - Stokenizuj uzyskane zdanie za pomocą funkcji
split()i znaku spacji, a wynik przypisz do zmiennejfirst_words. - Wyświetl stokenizowane słowa.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Iterate through the first 5 English and French sentences in the dataset
for en_sent, fr_sent in zip(____, ____):
print("English: ", en_sent)
print("\tFrench: ", fr_sent)
# Get the first sentence of the English dataset
first_sent = ____[____]
print("First sentence: ", first_sent)
# Tokenize the first sentence
____ = ____.____(____)
# Print the tokenized words
print("\tWords: ", ____)