Kom igångKom igång gratis

Ta bort stoppord

I följande övningar ska du rensa Enron-e-postmeddelandena för att kunna använda data i en ämnesmodell. Textrensning kan vara en utmaning, och du får lära dig några steg för att göra det på rätt sätt. Dataramen med e-postmeddelandena, df, finns tillgänglig. Som ett första steg behöver du definiera listan med stoppord och skiljetecken som ska tas bort från textdata i nästa övning. Nu kör vi.

Den här övningen är en del av kursen

Bedrägeridetektering i Python

Visa kurs

Övningsinstruktioner

  • Importera stopporden från ntlk.
  • Definiera engelska ord att använda som stoppord i variabeln stop.
  • Hämta skiljeteckensuppsättningen från paketet string och tilldela den till exclude.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import nltk packages and string 
from nltk.corpus import ____
import string

# Define stopwords to exclude
stop = set(____.____('____'))
stop.update(("to","cc","subject","http","from","sent", "ect", "u", "fwd", "www", "com"))

# Define punctuations to exclude and lemmatizer
exclude = set(____.____)
Redigera och kör kod