НачатьНачать бесплатно

Определение языка отзывов о товарах

Вы попрактикуетесь в определении языка на небольшом наборе данных non_english_reviews — выборке неанглоязычных отзывов из Amazon.

Вам предстоит итерироваться по строкам набора данных, определять язык каждой строки и добавлять результат в пустой список. Список нужно очистить так, чтобы он содержал только код языка — например, 'en' вместо стандартного вывода en:0.9987654. Помните, что функция определения языка может вернуть несколько вариантов, и первый из них является наиболее вероятным. В конце вы присвоите список новому столбцу.

Логика та же, что использовалась на слайдах и в предыдущем упражнении, однако теперь вы применяете функцию не к списку, а к набору данных.

Это упражнение является частью курса

Анализ тональности текста на Python

Посмотреть курс

Инструкции к упражнению

  • Выполните итерацию по строкам набора данных non_english_reviews.
  • Внутри цикла определите язык второго столбца набора данных.
  • Очистите строку, разбив её по символу : внутри выражения-генератора списка.
  • Присвойте очищенный список новому столбцу.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

from langdetect import detect_langs
languages = [] 

# Loop over the rows of the dataset and append  
for row in ____(____(non_english_reviews)):
    languages.append(____(non_english_reviews.iloc[row, 1]))

# Clean the list by splitting     
languages = [str(lang).____(':')[0][1:] for lang in languages]

# Assign the list to a new feature 
non_english_reviews['language'] = ____

print(non_english_reviews.head())
Редактировать и запускать код