Визначення мови в оглядах товарів
Ви попрактикуєте визначення мови на невеликому наборі даних non_english_reviews. Це вибірка неангломовних відгуків з Amazon product reviews.
Ви будете проходити по рядках набору даних, визначати мову кожного рядка та додавати її до порожнього списку. Список потрібно очистити так, щоб він містив лише код мови відгуку, наприклад 'en' для англійської, замість звичайного виводу en:0.9987654. Пам'ятайте, що функція визначення мови може знаходити більше ніж одну мову, і перший елемент у поверненому списку — найімовірніший кандидат. Нарешті, ви присвоїте цей список новій колонці.
Логіка така сама, як у слайдах і попередній вправі, але замість застосування функції до списку ви працюєте з набором даних.
Ця вправа є частиною курсу
Аналіз тональності в Python
Інструкції до вправи
- Проітерайтеся по рядках набору даних
non_english_reviews. - Усередині циклу визначайте мову другої колонки набору даних.
- Очистьте рядок, розділивши його за символом
:у виразі спискового включення (list comprehension). - Насамкінець присвойте очищений список новій колонці.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
from langdetect import detect_langs
languages = []
# Loop over the rows of the dataset and append
for row in ____(____(non_english_reviews)):
languages.append(____(non_english_reviews.iloc[row, 1]))
# Clean the list by splitting
languages = [str(lang).____(':')[0][1:] for lang in languages]
# Assign the list to a new feature
non_english_reviews['language'] = ____
print(non_english_reviews.head())