Podobnost dokumentů pomocí spaCy
Sémantická podobnost je proces, při kterém analyzuješ více vět a hledáš mezi nimi vzájemné podobnosti. V tomto cvičení si procvičíš výpočet sémantické podobnosti dokumentů vůči zadanému dokumentu. Cílem je kategorizovat seznam recenzí, které se vztahují k psím konzervám.
Kategorie psích konzerv je uložena v proměnné category. V seznamu texts je připraveno pět ukázkových recenzí jídla. Model en_core_web_md je načtený jako nlp.
Toto cvičení je součástí kurzu
Zpracování přirozeného jazyka s knihovnou spaCy
Pokyny k cvičení
- Vytvoř seznam
documentsobsahující kontejneryDocpro všechny prvky zetexts. - Vytvoř kontejner
Docprocategorya ulož ho jakocategory_document. - Projdi seznam
documentsa vypiš skóre podobnosti každého kontejneruDocvůčicategory_document, zaokrouhlené na tři desetinná místa.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a documents list containing Doc containers
documents = [____ for t in texts]
# Create a Doc container of the category
category = "canned dog food"
category_document = ____(____)
# Print similarity scores of each Doc container and the category_document
for i, doc in enumerate(documents):
print(f"Semantic similarity with document {i+1}:", round(doc.____(____), 3))