Inizia subitoInizia gratis

Parte 2: Esplorare l'insieme di dati

Ora esplorerai alcune caratteristiche dell’insieme di dati. In particolare, determinerai la lunghezza media (cioè il numero di parole) di tutte le frasi e la dimensione del vocabolario per l’insieme di dati in inglese.

Per questo esercizio è stato fornito l’insieme di dati inglese en_text, che contiene un elenco di frasi in inglese. In questo esercizio userai una funzione legata alle liste di Python chiamata <list>.extend(), che è una variante diversa della funzione <list>.append(). Capiremo la differenza con un esempio. Sia a=[1,2,3] e b=[4,5]. a.append(b) produce la lista [1,2,3,[4,5]], mentre a.extend(b) produce [1,2,3,4,5].

Questo esercizio fa parte del corso

Traduzione automatica con Keras

Visualizza corso

Istruzioni dell'esercizio

  • Calcola la lunghezza di ogni frase usando la funzione split() e la funzione len(), mentre iteri su en_text.
  • Calcola la lunghezza media delle frasi usando numpy.
  • Popola la lista all_words, nel corpo del ciclo for, aggiungendo tutte le parole trovate nelle frasi dopo la tokenizzazione.
  • Converte la lista all_words in un oggetto set e calcola la lunghezza/dimensione del set.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Compute length of sentences
sent_lengths = [len(____.____(____)) for en_sent in ____]
# Compute the mean of sentences lengths
mean_length = np.____(____)
print('(English) Mean sentence length: ', mean_length)

all_words = []
for sent in en_text:
  # Populate all_words with all the words in sentences
  all_words.____(____.____(____))
# Compute the length of the set containing all_words
vocab_size = len(____(____))
print("(English) Vocabulary size: ", vocab_size)
Modifica ed esegui il codice