Macierz podobieństwa kosinusowego korpusu
W tym ćwiczeniu masz do dyspozycji corpus – listę zawierającą pięć zdań, która jest wyświetlona w konsoli. Twoim zadaniem jest obliczenie macierzy podobieństwa kosinusowego, zawierającej parami wyznaczone wyniki podobieństwa kosinusowego dla każdej pary zdań (zwektoryzowanych metodą tf-idf).
Pamiętaj: wartość w i-tym wierszu i j-tej kolumnie macierzy podobieństwa oznacza wynik podobieństwa dla i-tego i j-tego wektora.
To ćwiczenie jest częścią kursu
Inżynieria cech dla NLP w Pythonie
Instrukcje do ćwiczenia
- Utwórz instancję
TfidfVectorizeri nadaj jej nazwętfidf_vectorizer. - Używając metody
fit_transform(), wygeneruj wektory tf-idf dlacorpus. Nazwij wyniktfidf_matrix. - Użyj funkcji
cosine_similarity()i przekażtfidf_matrixjako argument, aby obliczyć macierz podobieństwa kosinusowegocosine_sim.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Initialize an instance of tf-idf Vectorizer
tfidf_vectorizer = ____
# Generate the tf-idf vectors for the corpus
tfidf_matrix = tfidf_vectorizer.fit_transform(____)
# Compute and print the cosine similarity matrix
cosine_sim = ____(____, tfidf_matrix)
print(cosine_sim)