Začněte nyníZačněte zdarma

Podobnost dokumentů pomocí spaCy

Sémantická podobnost je proces, při kterém analyzuješ více vět a hledáš mezi nimi vzájemné podobnosti. V tomto cvičení si procvičíš výpočet sémantické podobnosti dokumentů vůči zadanému dokumentu. Cílem je kategorizovat seznam recenzí, které se vztahují k psím konzervám.

Kategorie psích konzerv je uložena v proměnné category. V seznamu texts je připraveno pět ukázkových recenzí jídla. Model en_core_web_md je načtený jako nlp.

Toto cvičení je součástí kurzu

Zpracování přirozeného jazyka s knihovnou spaCy

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř seznam documents obsahující kontejnery Doc pro všechny prvky ze texts.
  • Vytvoř kontejner Doc pro category a ulož ho jako category_document.
  • Projdi seznam documents a vypiš skóre podobnosti každého kontejneru Doc vůči category_document, zaokrouhlené na tři desetinná místa.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create a documents list containing Doc containers
documents = [____ for t in texts]

# Create a Doc container of the category
category = "canned dog food"
category_document = ____(____)

# Print similarity scores of each Doc container and the category_document
for i, doc in enumerate(documents):
  print(f"Semantic similarity with document {i+1}:", round(doc.____(____), 3))
Upravit a spustit kód