BaşlayınÜcretsiz başlayın

Stopword'leri kaldırma

Aşağıdaki egzersizlerde, verileri bir konu modelinde kullanabilmek için Enron e-postalarını temizleyeceksin. Metin temizleme zorlayıcı olabilir; bu yüzden bunu iyi yapmak için bazı adımları öğreneceksin. E-postaları içeren df veri çerçevesi hazır. İlk adımda, bir sonraki egzersizde metin verisinden kaldırılacak stopword ve noktalama işaretleri listesini tanımlaman gerekiyor. Hadi deneyelim.

Bu egzersiz, kursun bir parçasıdır

Python ile Sahtekarlık Tespiti

Kursa Göz Atın

Egzersiz talimatları

  • ntlk paketinden stopword'leri içe aktar.
  • stop değişkeni altında stopword olarak kullanılacak 'english' kelimelerini tanımla.
  • string paketinden noktalama kümesini al ve exclude değişkenine ata.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Import nltk packages and string 
from nltk.corpus import ____
import string

# Define stopwords to exclude
stop = set(____.____('____'))
stop.update(("to","cc","subject","http","from","sent", "ect", "u", "fwd", "www", "com"))

# Define punctuations to exclude and lemmatizer
exclude = set(____.____)
Kodu Düzenle ve Çalıştır