Partea 2: Explorarea setului de date
Acum vei explora câteva atribute ale setului de date. Mai exact, vei determina lungimea medie (adică numărul de cuvinte) a tuturor propozițiilor, precum și dimensiunea vocabularului pentru setul de date în limba engleză.
Pentru acest exercițiu, ți-a fost furnizat setul de date în engleză en_text, care conține o listă de propoziții în limba engleză. În acest exercițiu vei folosi o funcție Python pentru liste numită <list>.extend(), care este o variantă diferită a funcției <list>.append(). Să înțelegem diferența printr-un exemplu. Fie a=[1,2,3] și b=[4,5]. a.append(b) va produce lista [1,2,3,[4,5]], în timp ce a.extend(b) va produce [1,2,3,4,5].
Acest exercițiu face parte din cursul
Traducere automată cu Keras
Instrucțiuni pentru exercițiu
- Calculează lungimile fiecărei propoziții folosind funcția
split()și funcțialen(), iterând prinen_text. - Calculează lungimea medie a propozițiilor folosind
numpy. - Populează lista
all_words, în corpul bucleifor, adăugând toate cuvintele găsite în propoziții după tokenizare. - Convertește lista
all_wordsîntr-un obiect de tipsetși calculează lungimea/dimensiunea setului.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Compute length of sentences
sent_lengths = [len(____.____(____)) for en_sent in ____]
# Compute the mean of sentences lengths
mean_length = np.____(____)
print('(English) Mean sentence length: ', mean_length)
all_words = []
for sent in en_text:
# Populate all_words with all the words in sentences
all_words.____(____.____(____))
# Compute the length of the set containing all_words
vocab_size = len(____(____))
print("(English) Vocabulary size: ", vocab_size)