Ta bort stoppord
I följande övningar ska du rensa Enron-e-postmeddelandena för att kunna använda data i en ämnesmodell. Textrensning kan vara en utmaning, och du får lära dig några steg för att göra det på rätt sätt. Dataramen med e-postmeddelandena, df, finns tillgänglig. Som ett första steg behöver du definiera listan med stoppord och skiljetecken som ska tas bort från textdata i nästa övning. Nu kör vi.
Den här övningen är en del av kursen
Bedrägeridetektering i Python
Övningsinstruktioner
- Importera stopporden från
ntlk. - Definiera engelska ord att använda som stoppord i variabeln
stop. - Hämta skiljeteckensuppsättningen från paketet
stringoch tilldela den tillexclude.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import nltk packages and string
from nltk.corpus import ____
import string
# Define stopwords to exclude
stop = set(____.____('____'))
stop.update(("to","cc","subject","http","from","sent", "ect", "u", "fwd", "www", "com"))
# Define punctuations to exclude and lemmatizer
exclude = set(____.____)