ПочатиПочніть безкоштовно

Визначення мови в оглядах товарів

Ви попрактикуєте визначення мови на невеликому наборі даних non_english_reviews. Це вибірка неангломовних відгуків з Amazon product reviews.

Ви будете проходити по рядках набору даних, визначати мову кожного рядка та додавати її до порожнього списку. Список потрібно очистити так, щоб він містив лише код мови відгуку, наприклад 'en' для англійської, замість звичайного виводу en:0.9987654. Пам'ятайте, що функція визначення мови може знаходити більше ніж одну мову, і перший елемент у поверненому списку — найімовірніший кандидат. Нарешті, ви присвоїте цей список новій колонці.

Логіка така сама, як у слайдах і попередній вправі, але замість застосування функції до списку ви працюєте з набором даних.

Ця вправа є частиною курсу

Аналіз тональності в Python

Переглянути курс

Інструкції до вправи

  • Проітерайтеся по рядках набору даних non_english_reviews.
  • Усередині циклу визначайте мову другої колонки набору даних.
  • Очистьте рядок, розділивши його за символом : у виразі спискового включення (list comprehension).
  • Насамкінець присвойте очищений список новій колонці.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

from langdetect import detect_langs
languages = [] 

# Loop over the rows of the dataset and append  
for row in ____(____(non_english_reviews)):
    languages.append(____(non_english_reviews.iloc[row, 1]))

# Clean the list by splitting     
languages = [str(lang).____(':')[0][1:] for lang in languages]

# Assign the list to a new feature 
non_english_reviews['language'] = ____

print(non_english_reviews.head())
Редагувати та запускати код