EmpezarEmpieza gratis

Crea el diccionario y el corpus

Para ejecutar un modelo de temas LDA, primero tienes que definir el diccionario y el corpus, ya que serán la entrada del modelo. Vas a seguir trabajando con los datos de texto limpiados en los ejercicios anteriores. Eso significa que text_clean ya está disponible para que continúes y lo usarás para crear tu diccionario y tu corpus.

Este ejercicio tardará un poco más de lo habitual en ejecutarse.

Este ejercicio forma parte del curso

Fraud Detection in Python

Ver curso

Instrucciones del ejercicio

  • Importa el paquete gensim y, por separado, corpora desde gensim.
  • Define tu diccionario ejecutando la función correcta sobre tus datos limpios text_clean.
  • Define el corpus ejecutando doc2bow en cada texto de text_clean.
  • Imprime tus resultados para ver cómo quedan dictionary y corpus.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Import the packages
import ____
from ____ import ____

# Define the dictionary
dictionary = ____.____(____)

# Define the corpus 
corpus = [dictionary.____(text) for ___ in ____]

# Print corpus and dictionary
print(____)
print(____)
Editar y ejecutar código