Podobieństwo semantyczne w kategoryzacji tekstu
Głównym celem podobieństwa semantycznego jest mierzenie odległości między znaczeniami pary słów, fraz, zdań lub dokumentów. Na przykład słowo „car" jest bardziej podobne do „bus" niż do „cat". W tym ćwiczeniu znajdziesz zdania podobne do słowa sauce w przykładowym tekście z Amazon Fine Food Reviews. Biblioteka spacy umożliwia obliczenie oceny podobieństwa słowa sauce do każdego zdania w danym ciągu texts i wskazanie wyniku dla najbardziej podobnego zdania.
Ciąg texts jest już załadowany i zawiera dane z pola Text wszystkich recenzji. W tym ćwiczeniu użyjesz modelu angielskiego en_core_web_md, który jest już dostępny jako nlp.
To ćwiczenie jest częścią kursu
Przetwarzanie języka naturalnego z użyciem spaCy
Instrukcje do ćwiczenia
- Użyj
nlp, aby wygenerować konteneryDocdla słowasauceoraz dlatextsi przypisz je odpowiednio dokeyisentences. - Oblicz oceny podobieństwa słowa
saucedo każdego zdania w ciągutexts(zaokrąglone do dwóch miejsc po przecinku).
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Populate Doc containers for the word "sauce" and for "texts" string
key = ____
sentences = ____
# Calculate similarity score of each sentence and a Doc container for the word sauce
semantic_scores = []
for sent in sentences.____:
semantic_scores.append({"score": round(sent.____(____), 2)})
print(semantic_scores)