Del 2: Utforska datamängden
Nu ska du utforska några egenskaper hos datamängden. Mer specifikt ska du bestämma den genomsnittliga längden (dvs. antalet ord) för alla meningar samt storleken på vokabulären för den engelska datamängden.
I den här övningen finns den engelska datamängden en_text tillgänglig – en lista med engelska meningar. Du kommer att använda en Python-listfunktion som heter <list>.extend(), som skiljer sig från <list>.append(). Skillnaden kan förstås med ett exempel: om a=[1,2,3] och b=[4,5], ger a.append(b) listan [1,2,3,[4,5]], medan a.extend(b) ger [1,2,3,4,5].
Den här övningen är en del av kursen
Maskinöversättning med Keras
Övningsinstruktioner
- Beräkna längden på varje mening med hjälp av funktionerna
split()ochlen()medan du itererar genomen_text. - Beräkna medellängden på meningarna med
numpy. - Fyll listan
all_wordsi for-loopens kropp genom att lägga till alla ord som finns i meningarna efter tokenisering. - Konvertera listan
all_wordstill ettset-objekt och beräkna längden/storleken på setet.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Compute length of sentences
sent_lengths = [len(____.____(____)) for en_sent in ____]
# Compute the mean of sentences lengths
mean_length = np.____(____)
print('(English) Mean sentence length: ', mean_length)
all_words = []
for sent in en_text:
# Populate all_words with all the words in sentences
all_words.____(____.____(____))
# Compute the length of the set containing all_words
vocab_size = len(____(____))
print("(English) Vocabulary size: ", vocab_size)