Семантическое сходство для категоризации текста
Основная цель семантического сходства — измерить расстояние между смысловыми значениями пары слов, фраз, предложений или документов. Например, слово «car» ближе по смыслу к «bus», чем к «cat». В этом упражнении вы найдёте предложения, семантически близкие к слову sauce, в примере текста из Amazon Fine Food Reviews. С помощью spacy вы вычислите оценку сходства слова sauce с каждым предложением из заданной строки texts и определите наиболее похожее предложение.
Строка texts уже загружена и содержит данные поля Text из всех отзывов. В этом упражнении используется английская модель en_core_web_md, доступная как nlp.
Это упражнение является частью курса
Обработка естественного языка с помощью spaCy
Инструкции к упражнению
- Используйте
nlp, чтобы создать контейнерыDocдля словаsauceи для строкиtexts, и сохраните их в переменныеkeyиsentencesсоответственно. - Вычислите оценки сходства слова
sauceс каждым предложением из строкиtexts(округлите до двух знаков после запятой).
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Populate Doc containers for the word "sauce" and for "texts" string
key = ____
sentences = ____
# Calculate similarity score of each sentence and a Doc container for the word sauce
semantic_scores = []
for sent in sentences.____:
semantic_scores.append({"score": round(sent.____(____), 2)})
print(semantic_scores)