Część 2: Eksploracja zbioru danych
Teraz przyjrzysz się wybranym właściwościom zbioru danych. Konkretnie – wyznaczysz średnią długość zdań (czyli liczbę słów) oraz rozmiar słownika dla angielskiego zbioru danych.
W tym ćwiczeniu dostępny jest angielski zbiór danych en_text zawierający listę zdań w języku angielskim. Będziesz korzystać z funkcji listowej Pythona <list>.extend(), która różni się od <list>.append(). Zobaczmy tę różnicę na przykładzie. Niech a=[1,2,3] i b=[4,5]. Wywołanie a.append(b) da listę [1,2,3,[4,5]], natomiast a.extend(b) da [1,2,3,4,5].
To ćwiczenie jest częścią kursu
Tłumaczenie maszynowe z Keras
Instrukcje do ćwiczenia
- Oblicz długości poszczególnych zdań, używając funkcji
split()ilen()podczas iterowania poen_text. - Oblicz średnią długość zdań za pomocą biblioteki
numpy. - Wypełnij listę
all_wordsw ciele pętli for, dodając wszystkie słowa znalezione w zdaniach po tokenizacji. - Przekształć listę
all_wordsw obiektseti oblicz jego długość/rozmiar.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Compute length of sentences
sent_lengths = [len(____.____(____)) for en_sent in ____]
# Compute the mean of sentences lengths
mean_length = np.____(____)
print('(English) Mean sentence length: ', mean_length)
all_words = []
for sent in en_text:
# Populate all_words with all the words in sentences
all_words.____(____.____(____))
# Compute the length of the set containing all_words
vocab_size = len(____(____))
print("(English) Vocabulary size: ", vocab_size)