BaşlayınÜcretsiz başlayın

Ürün yorumlarında dil tespiti

non_english_reviews adlı küçük bir veri kümesi üzerinde dil tespiti pratik yapacaksın. Bu, Amazon ürün yorumlarından İngilizce olmayan yorumların bir örneklemesidir.

Veri kümesinin satırları üzerinde yineleme yapacak, her satırın dilini tespit edip boş bir listeye ekleyeceksin. Listeyi, standart çıktı en:0.9987654 yerine İngilizce için 'en' gibi yalnızca yorumun dilini içerecek şekilde temizlemen gerekiyor. Dil tespiti fonksiyonunun birden fazla dil döndürebileceğini ve dönen listenin ilk öğesinin en olası aday olduğunu unutma. Son olarak, bu listeyi yeni bir sütuna atayacaksın.

Mantık, slaytlarda ve önceki egzersizde kullandığınla aynı; ancak bu kez fonksiyonu bir listeye uygulamak yerine bir veri kümesiyle çalışıyorsun.

Bu egzersiz, kursun bir parçasıdır

Python ile Duygu Analizi

Kursa Göz Atın

Egzersiz talimatları

  • non_english_reviews veri kümesinin satırları üzerinde yineleme yap.
  • Döngü içinde, veri kümesinin ikinci sütununun dilini tespit et.
  • Liste üreteci ifadesi içinde : karakterine göre bölerek string’i temizle.
  • Son olarak, temizlenen listeyi yeni bir sütuna ata.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

from langdetect import detect_langs
languages = [] 

# Loop over the rows of the dataset and append  
for row in ____(____(non_english_reviews)):
    languages.append(____(non_english_reviews.iloc[row, 1]))

# Clean the list by splitting     
languages = [str(lang).____(':')[0][1:] for lang in languages]

# Assign the list to a new feature 
non_english_reviews['language'] = ____

print(non_english_reviews.head())
Kodu Düzenle ve Çalıştır