Zacznij terazZacznij za darmo

Wykrywanie języka w recenzjach produktów

Przećwiczysz wykrywanie języka na małym zbiorze danych o nazwie non_english_reviews. To próbka nieanglojęzycznych recenzji produktów z serwisu Amazon.

Będziesz iterować po wierszach zbioru danych, wykrywając język każdego wiersza i dodając wynik do pustej listy. Listę trzeba następnie oczyścić tak, aby zawierała tylko kod języka recenzji – na przykład 'en' zamiast pełnego wyniku en:0.9987654. Pamiętaj, że funkcja do wykrywania języka może zwrócić więcej niż jeden język, a pierwszy element zwróconej listy to najbardziej prawdopodobny kandydat. Na koniec przypiszesz listę do nowej kolumny.

Logika jest taka sama jak na slajdach i w poprzednim ćwiczeniu – z tą różnicą, że zamiast stosować funkcję do listy, pracujesz ze zbiorem danych.

To ćwiczenie jest częścią kursu

Analiza sentymentu w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Iteruj po wierszach zbioru danych non_english_reviews.
  • Wewnątrz pętli wykryj język drugiej kolumny zbioru danych.
  • Oczyść łańcuch znaków, dzieląc go po znaku : wewnątrz wyrażenia listowego.
  • Na koniec przypisz oczyszczoną listę do nowej kolumny.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

from langdetect import detect_langs
languages = [] 

# Loop over the rows of the dataset and append  
for row in ____(____(non_english_reviews)):
    languages.append(____(non_english_reviews.iloc[row, 1]))

# Clean the list by splitting     
languages = [str(lang).____(':')[0][1:] for lang in languages]

# Assign the list to a new feature 
non_english_reviews['language'] = ____

print(non_english_reviews.head())
Edytuj i uruchom kod