Zacznij terazZacznij za darmo

Podobieństwo obiektów Span w spaCy

Wyznaczanie podobieństwa semantycznego przydaje się do kategoryzowania tekstów, wykrywania treści powiązanych z danym tematem oraz identyfikowania duplikatów. W tym ćwiczeniu przećwiczysz obliczanie podobieństwa semantycznego fragmentów dokumentu (Span) względem zadanego dokumentu. Twoim celem jest znalezienie najbardziej trafnego obiektu Span złożonego z trzech tokenów, który odpowiada pojęciu karmione psie jedzenie w puszce.

Zadana kategoria karmionego psiego jedzenia w puszce jest przechowana w zmiennej category. Tekst jest już zapisany w obiekcie text, a model en_core_web_md został załadowany jako nlp. Kontener Doc dla zmiennej text został również już utworzony i zapisany w zmiennej document.

To ćwiczenie jest częścią kursu

Przetwarzanie języka naturalnego z użyciem spaCy

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz kontener Doc dla zmiennej category i zapisz go w zmiennej category_document.
  • Wyświetl wynik podobieństwa dla danego obiektu Span i zmiennej category_document, zaokrąglony do trzech miejsc po przecinku.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create a Doc container for the category
category = "canned dog food"
category_document = nlp(____)

# Print similarity score of a given Span and category_document
document_span = document[0:3]
print(f"Semantic similarity with", document_span.text, ":", round(document_span.____(____), 3))
Edytuj i uruchom kod