Inizia subitoInizia gratis

Prendere confidenza con i dati testuali

In questo esercizio giocherai con dati testuali analizzando citazioni di Sheldon Cooper della serie TV The Big Bang Theory. Questo ti darà l'opportunità di analizzare frasi per capire com'è lavorare con dati testuali reali.

Userai le dictionary comprehension per creare dizionari che mappano parole a indici e viceversa. L'uso dei dizionari invece, per esempio, di un pandas.DataFrame è preferibile perché sono più intuitivi e non aggiungono complessità non necessaria.

I dati sono disponibili in sheldon_quotes, con le prime due frasi già stampate per te.

Questo esercizio fa parte del corso

Reti Neurali Ricorrenti (RNN) per il Language Modeling con Keras

Visualizza corso

Istruzioni dell'esercizio

  • Esegui join delle frasi in un'unica variabile, poi estrai tutte le parole e salva questa lista in all_words.
  • Rimuovi le parole duplicate applicando list(set()) alla lista di parole e salva il risultato in unique_words.
  • Crea un dizionario con indici come chiavi e parole come valori usando le dictionary comprehension.
  • Crea un dizionario con parole come chiavi e indici come valori usando le dictionary comprehension.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Transform the list of sentences into a list of words
all_words = ' '.____(sheldon_quotes).split(' ')

# Get number of unique words
unique_words = list(set(all_words))

# Dictionary of indexes as keys and words as values
index_to_word = {____ for i, wd in enumerate(sorted(unique_words))}

print(index_to_word)

# Dictionary of words as keys and indexes as values
word_to_index = {wd:i for ____ in enumerate(sorted(unique_words))}

print(word_to_index)
Modifica ed esegui il codice