Cuvinte similare într-un vocabular
Găsirea termenilor similari din punct de vedere semantic are numeroase aplicații în regăsirea informațiilor. În acest exercițiu, vei exersa identificarea celui mai similar termen semantic pentru cuvântul computer din vocabularul modelului en_core_web_md.
Vectorul de cuvânt pentru computer este deja extras și stocat ca word_vector. Modelul en_core_web_md este deja încărcat ca nlp, iar pachetul NumPy este disponibil ca np.
Poți folosi funcția .most_similar() a obiectului nlp.vocab.vectors pentru a găsi termenii cei mai similari semantic. Folosind [0][0] pentru a indexa rezultatul acestei funcții vei obține ID-urile de cuvânt ale termenilor similari. nlp.vocab.strings[<un cuvânt dat>] poate fi utilizat pentru a găsi ID-ul unui cuvânt dat și poate returna, în mod similar, cuvântul asociat unui anumit ID.
Acest exercițiu face parte din cursul
Procesarea limbajului natural cu spaCy
Instrucțiuni pentru exercițiu
- Găsește cel mai similar termen semantic din vocabularul
en_core_web_md. - Obține lista cuvintelor similare pe baza ID-urilor de cuvânt ale termenilor similari.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Find the most similar word to the word computer
most_similar_words = nlp.vocab.vectors.____(np.asarray([____]), n = 1)
# Find the list of similar words given the word IDs
words = [nlp.____.____[____] for w in most_similar_words[0][0]]
print(words)