Parte 2: Esplorare l'insieme di dati
Ora esplorerai alcune caratteristiche dell’insieme di dati. In particolare, determinerai la lunghezza media (cioè il numero di parole) di tutte le frasi e la dimensione del vocabolario per l’insieme di dati in inglese.
Per questo esercizio è stato fornito l’insieme di dati inglese en_text, che contiene un elenco di frasi in inglese. In questo esercizio userai una funzione legata alle liste di Python chiamata <list>.extend(), che è una variante diversa della funzione <list>.append(). Capiremo la differenza con un esempio. Sia a=[1,2,3] e b=[4,5]. a.append(b) produce la lista [1,2,3,[4,5]], mentre a.extend(b) produce [1,2,3,4,5].
Questo esercizio fa parte del corso
Traduzione automatica con Keras
Istruzioni dell'esercizio
- Calcola la lunghezza di ogni frase usando la funzione
split()e la funzionelen(), mentre iteri suen_text. - Calcola la lunghezza media delle frasi usando
numpy. - Popola la lista
all_words, nel corpo del ciclo for, aggiungendo tutte le parole trovate nelle frasi dopo la tokenizzazione. - Converte la lista
all_wordsin un oggettosete calcola la lunghezza/dimensione del set.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Compute length of sentences
sent_lengths = [len(____.____(____)) for en_sent in ____]
# Compute the mean of sentences lengths
mean_length = np.____(____)
print('(English) Mean sentence length: ', mean_length)
all_words = []
for sent in en_text:
# Populate all_words with all the words in sentences
all_words.____(____.____(____))
# Compute the length of the set containing all_words
vocab_size = len(____(____))
print("(English) Vocabulary size: ", vocab_size)