НачатьНачать бесплатно

Настроения в сообществе самокатчиков

Городской совет хочет понять, как разные сообщества города относятся к самокатам. С момента первоначального анализа Сэм набор данных расширился: теперь он содержит отзывы на вьетнамском, тагальском, испанском и английском языках.

Совет просит Сэм разобраться в ситуации. Она решает использовать язык как приближённый показатель принадлежности к сообществу — по крайней мере, с теми данными, которые у неё есть.

Сэм уже загрузила CSV-файл в переменную scooter_df:

Scooter dataframe contents

В этом упражнении вы поможете Сэм проанализировать тональность текстов на разных языках. Это позволит городу понять, как разные сообщества относятся к самокатам, — а это напрямую влияет на позицию членов Городского совета.

Это упражнение является частью курса

Введение в AWS Boto на Python

Посмотреть курс

Инструкции к упражнению

  • Для каждой строки DataFrame определите доминирующий язык.
  • Используйте определённый язык, чтобы выявить тональность описания.
  • Сгруппируйте DataFrame по столбцам 'sentiment' и 'lang' именно в таком порядке.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

for index, row in scooter_requests.iterrows():
  	# For every DataFrame row
    desc = scooter_requests.loc[index, 'public_description']
    if desc != '':
      	# Detect the dominant language
        resp = comprehend.____(____=desc)
        lang_code = resp['Languages'][0]['LanguageCode']
        scooter_requests.loc[index, 'lang'] = lang_code
        # Use the detected language to determine sentiment
        scooter_requests.loc[index, 'sentiment'] = comprehend.____(
          ____=desc, 
          ____=lang_code)['____']
# Perform a count of sentiment by group.
counts = scooter_requests.groupby(['sentiment', 'lang']).count()
counts.head()
Редактировать и запускать код