Ürün yorumlarında dil tespiti
non_english_reviews adlı küçük bir veri kümesi üzerinde dil tespiti pratik yapacaksın. Bu, Amazon ürün yorumlarından İngilizce olmayan yorumların bir örneklemesidir.
Veri kümesinin satırları üzerinde yineleme yapacak, her satırın dilini tespit edip boş bir listeye ekleyeceksin. Listeyi, standart çıktı en:0.9987654 yerine İngilizce için 'en' gibi yalnızca yorumun dilini içerecek şekilde temizlemen gerekiyor. Dil tespiti fonksiyonunun birden fazla dil döndürebileceğini ve dönen listenin ilk öğesinin en olası aday olduğunu unutma. Son olarak, bu listeyi yeni bir sütuna atayacaksın.
Mantık, slaytlarda ve önceki egzersizde kullandığınla aynı; ancak bu kez fonksiyonu bir listeye uygulamak yerine bir veri kümesiyle çalışıyorsun.
Bu egzersiz, kursun bir parçasıdır
Python ile Duygu Analizi
Egzersiz talimatları
non_english_reviewsveri kümesinin satırları üzerinde yineleme yap.- Döngü içinde, veri kümesinin ikinci sütununun dilini tespit et.
- Liste üreteci ifadesi içinde
:karakterine göre bölerek string’i temizle. - Son olarak, temizlenen listeyi yeni bir sütuna ata.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
from langdetect import detect_langs
languages = []
# Loop over the rows of the dataset and append
for row in ____(____(non_english_reviews)):
languages.append(____(non_english_reviews.iloc[row, 1]))
# Clean the list by splitting
languages = [str(lang).____(':')[0][1:] for lang in languages]
# Assign the list to a new feature
non_english_reviews['language'] = ____
print(non_english_reviews.head())