Măsurarea similarității dintre vectorii de cuvinte
În această lecție vom înțelege puterea vectorilor de cuvinte folosind vectori antrenați pe date reale. Aceștia sunt vectori de cuvinte extrași dintr-o listă publicată de grupul Stanford NLP. Un vector de cuvânt este o secvență sau un vector de valori numerice. De exemplu,
dog = (0.31, 0.92, 0.13)
Distanța dintre vectorii de cuvinte poate fi măsurată cu o metrică de similaritate pereche. Aici vom folosi sklearn.metrics.pairwise.cosine_similarity. Similaritatea cosinus returnează valori mai mari atunci când similaritatea element cu element a doi vectori este ridicată, și invers.
Acest exercițiu face parte din cursul
Traducere automată cu Keras
Instrucțiuni pentru exercițiu
- Afișează lungimea vectorului
cat_vectorfolosind atributulndarray.size. - Calculează și afișează similaritatea dintre
cat_vectorșiwindow_vectorfolosindcosine_similarity. - Calculează și afișează similaritatea dintre
cat_vectorșidog_vectorfolosindcosine_similarity.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
from sklearn.metrics.pairwise import cosine_similarity
# Print the length of the cat_vector
print('Length of the cat_vector: ', ____.____)
# Compute and print the similarity between cat and window vectors
dist_cat_window = ____(____, window_vector)
print('Similarity(cat, window): ', ____)
# Compute and print the similarity between cat and dog vectors
print('Similarity(cat,dog): ', ____(____, ____))