Eliminar stopwords
En los siguientes ejercicios vas a limpiar los correos de Enron para poder usar los datos en un modelo de temas. Limpiar texto puede ser un reto, así que verás algunos pasos para hacerlo bien. Tienes disponible el dataframe con los correos, df. En un primer paso, necesitas definir la lista de stopwords y signos de puntuación que se eliminarán del texto en el siguiente ejercicio. Vamos a ello.
Este ejercicio forma parte del curso
Fraud Detection in Python
Instrucciones del ejercicio
- Importa las stopwords de
ntlk. - Define las palabras 'english' a usar como stopwords en la variable
stop. - Obtén el conjunto de signos de puntuación del paquete
stringy asígnalo aexclude.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Import nltk packages and string
from nltk.corpus import ____
import string
# Define stopwords to exclude
stop = set(____.____('____'))
stop.update(("to","cc","subject","http","from","sent", "ect", "u", "fwd", "www", "com"))
# Define punctuations to exclude and lemmatizer
exclude = set(____.____)