Zacznij terazZacznij za darmo

Część 2: Eksploracja zbioru danych

Teraz przyjrzysz się wybranym właściwościom zbioru danych. Konkretnie – wyznaczysz średnią długość zdań (czyli liczbę słów) oraz rozmiar słownika dla angielskiego zbioru danych.

W tym ćwiczeniu dostępny jest angielski zbiór danych en_text zawierający listę zdań w języku angielskim. Będziesz korzystać z funkcji listowej Pythona <list>.extend(), która różni się od <list>.append(). Zobaczmy tę różnicę na przykładzie. Niech a=[1,2,3] i b=[4,5]. Wywołanie a.append(b) da listę [1,2,3,[4,5]], natomiast a.extend(b) da [1,2,3,4,5].

To ćwiczenie jest częścią kursu

Tłumaczenie maszynowe z Keras

Zobacz kurs

Instrukcje do ćwiczenia

  • Oblicz długości poszczególnych zdań, używając funkcji split() i len() podczas iterowania po en_text.
  • Oblicz średnią długość zdań za pomocą biblioteki numpy.
  • Wypełnij listę all_words w ciele pętli for, dodając wszystkie słowa znalezione w zdaniach po tokenizacji.
  • Przekształć listę all_words w obiekt set i oblicz jego długość/rozmiar.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Compute length of sentences
sent_lengths = [len(____.____(____)) for en_sent in ____]
# Compute the mean of sentences lengths
mean_length = np.____(____)
print('(English) Mean sentence length: ', mean_length)

all_words = []
for sent in en_text:
  # Populate all_words with all the words in sentences
  all_words.____(____.____(____))
# Compute the length of the set containing all_words
vocab_size = len(____(____))
print("(English) Vocabulary size: ", vocab_size)
Edytuj i uruchom kod