Podobieństwo dokumentów w spaCy
Podobieństwo semantyczne polega na analizie wielu zdań w celu wykrycia zależności między nimi. W tym ćwiczeniu przećwiczysz obliczanie podobieństwa semantycznego dokumentów względem wskazanego dokumentu bazowego. Celem jest kategoryzacja listy recenzji powiązanych z karmą dla psów w puszce.
Kategoria karma dla psów w puszce jest przechowywana w zmiennej category. Próbka pięciu recenzji żywności została dostarczona w liście o nazwie texts. Model en_core_web_md jest załadowany jako nlp.
To ćwiczenie jest częścią kursu
Przetwarzanie języka naturalnego z użyciem spaCy
Instrukcje do ćwiczenia
- Utwórz listę
documentszawierającą obiektyDocdla wszystkich elementów listytexts. - Utwórz obiekt
Docdla zmiennejcategoryi zapisz go jakocategory_document. - Przejdź przez elementy listy
documentsi wyświetl wyniki podobieństwa każdego obiektuDocwzględemcategory_document, zaokrąglone do trzech miejsc po przecinku.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create a documents list containing Doc containers
documents = [____ for t in texts]
# Create a Doc container of the category
category = "canned dog food"
category_document = ____(____)
# Print similarity scores of each Doc container and the category_document
for i, doc in enumerate(documents):
print(f"Semantic similarity with document {i+1}:", round(doc.____(____), 3))