Prendere confidenza con i dati testuali
In questo esercizio giocherai con dati testuali analizzando citazioni di Sheldon Cooper della serie TV The Big Bang Theory. Questo ti darà l'opportunità di analizzare frasi per capire com'è lavorare con dati testuali reali.
Userai le dictionary comprehension per creare dizionari che mappano parole a indici e viceversa. L'uso dei dizionari invece, per esempio, di un pandas.DataFrame è preferibile perché sono più intuitivi e non aggiungono complessità non necessaria.
I dati sono disponibili in sheldon_quotes, con le prime due frasi già stampate per te.
Questo esercizio fa parte del corso
Reti Neurali Ricorrenti (RNN) per il Language Modeling con Keras
Istruzioni dell'esercizio
- Esegui
joindelle frasi in un'unica variabile, poi estrai tutte le parole e salva questa lista inall_words. - Rimuovi le parole duplicate applicando
list(set())alla lista di parole e salva il risultato inunique_words. - Crea un dizionario con indici come chiavi e parole come valori usando le dictionary comprehension.
- Crea un dizionario con parole come chiavi e indici come valori usando le dictionary comprehension.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Transform the list of sentences into a list of words
all_words = ' '.____(sheldon_quotes).split(' ')
# Get number of unique words
unique_words = list(set(all_words))
# Dictionary of indexes as keys and words as values
index_to_word = {____ for i, wd in enumerate(sorted(unique_words))}
print(index_to_word)
# Dictionary of words as keys and indexes as values
word_to_index = {wd:i for ____ in enumerate(sorted(unique_words))}
print(word_to_index)