Настроения в сообществе самокатчиков
Городской совет хочет понять, как разные сообщества города относятся к самокатам. С момента первоначального анализа Сэм набор данных расширился: теперь он содержит отзывы на вьетнамском, тагальском, испанском и английском языках.
Совет просит Сэм разобраться в ситуации. Она решает использовать язык как приближённый показатель принадлежности к сообществу — по крайней мере, с теми данными, которые у неё есть.
Сэм уже загрузила CSV-файл в переменную scooter_df:

В этом упражнении вы поможете Сэм проанализировать тональность текстов на разных языках. Это позволит городу понять, как разные сообщества относятся к самокатам, — а это напрямую влияет на позицию членов Городского совета.
Это упражнение является частью курса
Введение в AWS Boto на Python
Инструкции к упражнению
- Для каждой строки DataFrame определите доминирующий язык.
- Используйте определённый язык, чтобы выявить тональность описания.
- Сгруппируйте DataFrame по столбцам
'sentiment'и'lang'именно в таком порядке.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
for index, row in scooter_requests.iterrows():
# For every DataFrame row
desc = scooter_requests.loc[index, 'public_description']
if desc != '':
# Detect the dominant language
resp = comprehend.____(____=desc)
lang_code = resp['Languages'][0]['LanguageCode']
scooter_requests.loc[index, 'lang'] = lang_code
# Use the detected language to determine sentiment
scooter_requests.loc[index, 'sentiment'] = comprehend.____(
____=desc,
____=lang_code)['____']
# Perform a count of sentiment by group.
counts = scooter_requests.groupby(['sentiment', 'lang']).count()
counts.head()