Créer le dictionnaire et le corpus
Pour exécuter un modèle de sujets LDA, vous devez d'abord définir votre dictionnaire et votre corpus, puisqu'ils seront utilisés par le modèle. Vous allez poursuivre avec les textes nettoyés préparés dans les exercices précédents. Autrement dit, text_clean est déjà à votre disposition pour continuer, et vous l'utiliserez pour créer votre dictionnaire et votre corpus.
Cet exercice prendra un peu plus de temps à s'exécuter que d'habitude.
Cette activité fait partie du cours
Détection de fraude en Python
Instructions de l’exercice
- Importez le paquet gensim et
corporaà partir de gensim séparément. - Définissez votre dictionnaire en exécutant la fonction appropriée sur vos données nettoyées
text_clean. - Définissez le corpus en exécutant
doc2bowsur chaque élément de texte danstext_clean. - Affichez vos résultats pour voir à quoi ressemblent
dictionaryetcorpus.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import the packages
import ____
from ____ import ____
# Define the dictionary
dictionary = ____.____(____)
# Define the corpus
corpus = [dictionary.____(text) for ___ in ____]
# Print corpus and dictionary
print(____)
print(____)