CommencezCommencez gratuitement

Créer le dictionnaire et le corpus

Pour exécuter un modèle de sujets LDA, vous devez d'abord définir votre dictionnaire et votre corpus, puisqu'ils seront utilisés par le modèle. Vous allez poursuivre avec les textes nettoyés préparés dans les exercices précédents. Autrement dit, text_clean est déjà à votre disposition pour continuer, et vous l'utiliserez pour créer votre dictionnaire et votre corpus.

Cet exercice prendra un peu plus de temps à s'exécuter que d'habitude.

Cette activité fait partie du cours

Détection de fraude en Python

Voir le cours

Instructions de l’exercice

  • Importez le paquet gensim et corpora à partir de gensim séparément.
  • Définissez votre dictionnaire en exécutant la fonction appropriée sur vos données nettoyées text_clean.
  • Définissez le corpus en exécutant doc2bow sur chaque élément de texte dans text_clean.
  • Affichez vos résultats pour voir à quoi ressemblent dictionary et corpus.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import the packages
import ____
from ____ import ____

# Define the dictionary
dictionary = ____.____(____)

# Define the corpus 
corpus = [dictionary.____(text) for ___ in ____]

# Print corpus and dictionary
print(____)
print(____)
Modifier et exécuter le code