Crea el diccionario y el corpus
Para ejecutar un modelo de temas LDA, primero tienes que definir el diccionario y el corpus, ya que serán la entrada del modelo. Vas a seguir trabajando con los datos de texto limpiados en los ejercicios anteriores. Eso significa que text_clean ya está disponible para que continúes y lo usarás para crear tu diccionario y tu corpus.
Este ejercicio tardará un poco más de lo habitual en ejecutarse.
Este ejercicio forma parte del curso
Fraud Detection in Python
Instrucciones del ejercicio
- Importa el paquete gensim y, por separado,
corporadesde gensim. - Define tu diccionario ejecutando la función correcta sobre tus datos limpios
text_clean. - Define el corpus ejecutando
doc2bowen cada texto detext_clean. - Imprime tus resultados para ver cómo quedan
dictionaryycorpus.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Import the packages
import ____
from ____ import ____
# Define the dictionary
dictionary = ____.____(____)
# Define the corpus
corpus = [dictionary.____(text) for ___ in ____]
# Print corpus and dictionary
print(____)
print(____)