BaşlayınÜcretsiz başlayın

Metin verisini temizleme

Durak sözcükleri (stopwords) ve noktalama işaretlerini tanımladığına göre, bunları kullanarak veri çerçevesi df içindeki enron e-postalarını daha da temizleyelim. Durak sözcükleri ve noktalama işaretlerini içeren listeler sırasıyla stop ve exclude altında mevcut. Veriyi tamamen temizlemeden önce yapman gereken birkaç adım daha var; örneğin kelimelerin "lemmatization" işlemi ve fiillerin köklerine indirgenmesi (stemming). E-posta verisindeki fiiller zaten köklere indirgenmiş durumda ve bu egzersizde lemmatization da senin için yapıldı.

Bu egzersiz, kursun bir parçasıdır

Python ile Sahtekarlık Tespiti

Kursa Göz Atın

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Import the lemmatizer from nltk
from nltk.stem.wordnet import WordNetLemmatizer
lemma = WordNetLemmatizer()

# Define word cleaning function
def clean(text, stop):
    text = text.____()
	# Remove stopwords
    stop_free = " ".join([word for word in text.lower().split() if ((___ not in ___) and (not word.isdigit()))])
	# Remove punctuations
    punc_free = ''.join(word for word in stop_free if ___ not in ____)
	# Lemmatize all words
    normalized = " ".join(____.____(word) for word in punc_free.split())      
    return normalized
Kodu Düzenle ve Çalıştır