Kom igångKom igång gratis

Del 2: Utforska datamängden

Nu ska du utforska några egenskaper hos datamängden. Mer specifikt ska du bestämma den genomsnittliga längden (dvs. antalet ord) för alla meningar samt storleken på vokabulären för den engelska datamängden.

I den här övningen finns den engelska datamängden en_text tillgänglig – en lista med engelska meningar. Du kommer att använda en Python-listfunktion som heter <list>.extend(), som skiljer sig från <list>.append(). Skillnaden kan förstås med ett exempel: om a=[1,2,3] och b=[4,5], ger a.append(b) listan [1,2,3,[4,5]], medan a.extend(b) ger [1,2,3,4,5].

Den här övningen är en del av kursen

Maskinöversättning med Keras

Visa kurs

Övningsinstruktioner

  • Beräkna längden på varje mening med hjälp av funktionerna split() och len() medan du itererar genom en_text.
  • Beräkna medellängden på meningarna med numpy.
  • Fyll listan all_words i for-loopens kropp genom att lägga till alla ord som finns i meningarna efter tokenisering.
  • Konvertera listan all_words till ett set-objekt och beräkna längden/storleken på setet.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Compute length of sentences
sent_lengths = [len(____.____(____)) for en_sent in ____]
# Compute the mean of sentences lengths
mean_length = np.____(____)
print('(English) Mean sentence length: ', mean_length)

all_words = []
for sent in en_text:
  # Populate all_words with all the words in sentences
  all_words.____(____.____(____))
# Compute the length of the set containing all_words
vocab_size = len(____(____))
print("(English) Vocabulary size: ", vocab_size)
Redigera och kör kod