CommencezCommencez gratuitement

Se familiariser avec les données textuelles

Dans cet exercice, vous allez manipuler des données textuelles en analysant des répliques de Sheldon Cooper dans l'émission The Big Bang Theory. Cela vous donnera l'occasion d'examiner des phrases afin de mieux comprendre ce que signifie travailler avec des données textuelles réelles.

Vous utiliserez des compréhensions de dictionnaires pour créer des dictionnaires qui font la correspondance entre les mots et les index, et l'inverse. On privilégie les dictionnaires plutôt que, par exemple, un pandas.DataFrame, parce qu'ils sont plus intuitifs et n'ajoutent pas de complexité inutile.

Les données sont disponibles dans sheldon_quotes, et les deux premières phrases sont déjà affichées pour vous.

Cette activité fait partie du cours

Réseaux de neurones récurrents (RNN) pour la modélisation du langage avec Keras

Voir le cours

Instructions de l’exercice

  • Faites join des phrases dans une seule variable, puis extrayez tous les mots et stockez cette liste dans all_words.
  • Supprimez les mots en double en appliquant list(set()) à la liste de mots et stockez-les dans unique_words.
  • Créez un dictionnaire avec les index comme clés et les mots comme valeurs à l'aide de compréhensions de dictionnaires.
  • Créez un dictionnaire avec les mots comme clés et les index comme valeurs à l'aide de compréhensions de dictionnaires.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Transform the list of sentences into a list of words
all_words = ' '.____(sheldon_quotes).split(' ')

# Get number of unique words
unique_words = list(set(all_words))

# Dictionary of indexes as keys and words as values
index_to_word = {____ for i, wd in enumerate(sorted(unique_words))}

print(index_to_word)

# Dictionary of words as keys and indexes as values
word_to_index = {wd:i for ____ in enumerate(sorted(unique_words))}

print(word_to_index)
Modifier et exécuter le code