Bekanta dig med textdata
I den här övningen arbetar du med textdata genom att analysera citat från Sheldon Cooper i TV-serien The Big Bang Theory. Det ger dig en chans att utforska meningar och få en känsla för hur det är att hantera textdata från verkligheten.
Du använder dictionary comprehensions för att skapa ordlistor som mappar ord till index och vice versa. Anledningen till att vi använder ordlistor i stället för till exempel en pandas.DataFrame är att de är mer intuitiva och inte tillför onödig komplexitet.
Data finns tillgänglig i sheldon_quotes, och de två första meningarna är redan utskrivna åt dig.
Den här övningen är en del av kursen
Återkommande neurala nätverk (RNN) för språkmodellering med Keras
Övningsinstruktioner
- Använd
joinför att slå ihop meningarna till en variabel och extrahera sedan alla ord – lagra listan iall_words. - Ta bort dubbletter genom att använda
list(set())på ordlistan och lagra resultatet iunique_words. - Skapa en ordlista med index som nycklar och ord som värden med hjälp av dictionary comprehensions.
- Skapa en ordlista med ord som nycklar och index som värden med hjälp av dictionary comprehensions.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Transform the list of sentences into a list of words
all_words = ' '.____(sheldon_quotes).split(' ')
# Get number of unique words
unique_words = list(set(all_words))
# Dictionary of indexes as keys and words as values
index_to_word = {____ for i, wd in enumerate(sorted(unique_words))}
print(index_to_word)
# Dictionary of words as keys and indexes as values
word_to_index = {wd:i for ____ in enumerate(sorted(unique_words))}
print(word_to_index)