ÎncepețiÎncepe gratuit

Partea 2: Explorarea setului de date

Acum vei explora câteva atribute ale setului de date. Mai exact, vei determina lungimea medie (adică numărul de cuvinte) a tuturor propozițiilor, precum și dimensiunea vocabularului pentru setul de date în limba engleză.

Pentru acest exercițiu, ți-a fost furnizat setul de date în engleză en_text, care conține o listă de propoziții în limba engleză. În acest exercițiu vei folosi o funcție Python pentru liste numită <list>.extend(), care este o variantă diferită a funcției <list>.append(). Să înțelegem diferența printr-un exemplu. Fie a=[1,2,3] și b=[4,5]. a.append(b) va produce lista [1,2,3,[4,5]], în timp ce a.extend(b) va produce [1,2,3,4,5].

Acest exercițiu face parte din cursul

Traducere automată cu Keras

Vezi cursul

Instrucțiuni pentru exercițiu

  • Calculează lungimile fiecărei propoziții folosind funcția split() și funcția len(), iterând prin en_text.
  • Calculează lungimea medie a propozițiilor folosind numpy.
  • Populează lista all_words, în corpul buclei for, adăugând toate cuvintele găsite în propoziții după tokenizare.
  • Convertește lista all_words într-un obiect de tip set și calculează lungimea/dimensiunea setului.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Compute length of sentences
sent_lengths = [len(____.____(____)) for en_sent in ____]
# Compute the mean of sentences lengths
mean_length = np.____(____)
print('(English) Mean sentence length: ', mean_length)

all_words = []
for sent in en_text:
  # Populate all_words with all the words in sentences
  all_words.____(____.____(____))
# Compute the length of the set containing all_words
vocab_size = len(____(____))
print("(English) Vocabulary size: ", vocab_size)
Editează și rulează codul