Podobieństwo obiektów Span w spaCy
Wyznaczanie podobieństwa semantycznego przydaje się do kategoryzowania tekstów, wykrywania treści powiązanych z danym tematem oraz identyfikowania duplikatów. W tym ćwiczeniu przećwiczysz obliczanie podobieństwa semantycznego fragmentów dokumentu (Span) względem zadanego dokumentu. Twoim celem jest znalezienie najbardziej trafnego obiektu Span złożonego z trzech tokenów, który odpowiada pojęciu karmione psie jedzenie w puszce.
Zadana kategoria karmionego psiego jedzenia w puszce jest przechowana w zmiennej category. Tekst jest już zapisany w obiekcie text, a model en_core_web_md został załadowany jako nlp. Kontener Doc dla zmiennej text został również już utworzony i zapisany w zmiennej document.
To ćwiczenie jest częścią kursu
Przetwarzanie języka naturalnego z użyciem spaCy
Instrukcje do ćwiczenia
- Utwórz kontener
Docdla zmiennejcategoryi zapisz go w zmiennejcategory_document. - Wyświetl wynik podobieństwa dla danego obiektu
Spani zmiennejcategory_document, zaokrąglony do trzech miejsc po przecinku.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create a Doc container for the category
category = "canned dog food"
category_document = nlp(____)
# Print similarity score of a given Span and category_document
document_span = document[0:3]
print(f"Semantic similarity with", document_span.text, ":", round(document_span.____(____), 3))