Wykrywanie języka w recenzjach produktów
Przećwiczysz wykrywanie języka na małym zbiorze danych o nazwie non_english_reviews. To próbka nieanglojęzycznych recenzji produktów z serwisu Amazon.
Będziesz iterować po wierszach zbioru danych, wykrywając język każdego wiersza i dodając wynik do pustej listy. Listę trzeba następnie oczyścić tak, aby zawierała tylko kod języka recenzji – na przykład 'en' zamiast pełnego wyniku en:0.9987654. Pamiętaj, że funkcja do wykrywania języka może zwrócić więcej niż jeden język, a pierwszy element zwróconej listy to najbardziej prawdopodobny kandydat. Na koniec przypiszesz listę do nowej kolumny.
Logika jest taka sama jak na slajdach i w poprzednim ćwiczeniu – z tą różnicą, że zamiast stosować funkcję do listy, pracujesz ze zbiorem danych.
To ćwiczenie jest częścią kursu
Analiza sentymentu w Pythonie
Instrukcje do ćwiczenia
- Iteruj po wierszach zbioru danych
non_english_reviews. - Wewnątrz pętli wykryj język drugiej kolumny zbioru danych.
- Oczyść łańcuch znaków, dzieląc go po znaku
:wewnątrz wyrażenia listowego. - Na koniec przypisz oczyszczoną listę do nowej kolumny.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
from langdetect import detect_langs
languages = []
# Loop over the rows of the dataset and append
for row in ____(____(non_english_reviews)):
languages.append(____(non_english_reviews.iloc[row, 1]))
# Clean the list by splitting
languages = [str(lang).____(':')[0][1:] for lang in languages]
# Assign the list to a new feature
non_english_reviews['language'] = ____
print(non_english_reviews.head())