Stopword'leri kaldırma
Aşağıdaki egzersizlerde, verileri bir konu modelinde kullanabilmek için Enron e-postalarını temizleyeceksin. Metin temizleme zorlayıcı olabilir; bu yüzden bunu iyi yapmak için bazı adımları öğreneceksin. E-postaları içeren df veri çerçevesi hazır. İlk adımda, bir sonraki egzersizde metin verisinden kaldırılacak stopword ve noktalama işaretleri listesini tanımlaman gerekiyor. Hadi deneyelim.
Bu egzersiz, kursun bir parçasıdır
Python ile Sahtekarlık Tespiti
Egzersiz talimatları
ntlkpaketinden stopword'leri içe aktar.stopdeğişkeni altında stopword olarak kullanılacak 'english' kelimelerini tanımla.stringpaketinden noktalama kümesini al veexcludedeğişkenine ata.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Import nltk packages and string
from nltk.corpus import ____
import string
# Define stopwords to exclude
stop = set(____.____('____'))
stop.update(("to","cc","subject","http","from","sent", "ect", "u", "fwd", "www", "com"))
# Define punctuations to exclude and lemmatizer
exclude = set(____.____)