EmpezarEmpieza gratis

Eliminar stopwords

En los siguientes ejercicios vas a limpiar los correos de Enron para poder usar los datos en un modelo de temas. Limpiar texto puede ser un reto, así que verás algunos pasos para hacerlo bien. Tienes disponible el dataframe con los correos, df. En un primer paso, necesitas definir la lista de stopwords y signos de puntuación que se eliminarán del texto en el siguiente ejercicio. Vamos a ello.

Este ejercicio forma parte del curso

Fraud Detection in Python

Ver curso

Instrucciones del ejercicio

  • Importa las stopwords de ntlk.
  • Define las palabras 'english' a usar como stopwords en la variable stop.
  • Obtén el conjunto de signos de puntuación del paquete string y asígnalo a exclude.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Import nltk packages and string 
from nltk.corpus import ____
import string

# Define stopwords to exclude
stop = set(____.____('____'))
stop.update(("to","cc","subject","http","from","sent", "ect", "u", "fwd", "www", "com"))

# Define punctuations to exclude and lemmatizer
exclude = set(____.____)
Editar y ejecutar código