CommencezCommencez gratuitement

Créer des vecteurs de phrases et de caractères suivants

Cet exercice met l'accent sur l'importance de la préparation des données. Vous utiliserez des textes contenant des répliques du personnage Sheldon de l'émission The Big Bang Theory comme données d'entrée et vous créerez des vecteurs d'indices de phrases et de caractères suivants, nécessaires avant de bâtir un modèle de génération de texte.

Le texte est disponible dans la variable sheldon, tout comme le vocabulaire (caractères) dans la variable vocabulary, et les hyperparamètres chars_window et step définis aux valeurs 20 et 3. Cela signifie qu'une séquence de 20 caractères servira à prédire le suivant et que la fenêtre se déplacera de 3 caractères à chaque itération.

Le paquet pandas sous l'alias pd est également chargé dans l'environnement.

Cette activité fait partie du cours

Réseaux de neurones récurrents (RNN) pour la modélisation du langage avec Keras

Voir le cours

Instructions de l’exercice

  • Scindez le texte par saut de ligne pour parcourir les phrases.
  • Itérez jusqu'à la fin de la phrase moins chars_window.
  • Ajoutez à la variable sentences la portion de phrase qui contient chars_window caractères et ajoutez le caractère suivant à la variable next_chars.
  • Utilisez les vecteurs obtenus pour créer un pd.DataFrame() et affichez ses premières lignes.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Instantiate the vectors
sentences = []
next_chars = []
# Loop for every sentence
for sentence in sheldon.____:
    # Get 20 previous chars and next char; then shift by step
    for i in range(0, len(sentence) - ____, step):
        sentences.append(sentence[i:i + ____])
        next_chars.append(sentence[____ + chars_window])

# Define a Data Frame with the vectors
df = pd.DataFrame({'sentence': ____, 'next_char': ____})

# Print the initial rows
print(df.head())
Modifier et exécuter le code