Zacznij terazZacznij za darmo

Macierz podobieństwa kosinusowego korpusu

W tym ćwiczeniu masz do dyspozycji corpus – listę zawierającą pięć zdań, która jest wyświetlona w konsoli. Twoim zadaniem jest obliczenie macierzy podobieństwa kosinusowego, zawierającej parami wyznaczone wyniki podobieństwa kosinusowego dla każdej pary zdań (zwektoryzowanych metodą tf-idf).

Pamiętaj: wartość w i-tym wierszu i j-tej kolumnie macierzy podobieństwa oznacza wynik podobieństwa dla i-tego i j-tego wektora.

To ćwiczenie jest częścią kursu

Inżynieria cech dla NLP w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz instancję TfidfVectorizer i nadaj jej nazwę tfidf_vectorizer.
  • Używając metody fit_transform(), wygeneruj wektory tf-idf dla corpus. Nazwij wynik tfidf_matrix.
  • Użyj funkcji cosine_similarity() i przekaż tfidf_matrix jako argument, aby obliczyć macierz podobieństwa kosinusowego cosine_sim.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Initialize an instance of tf-idf Vectorizer
tfidf_vectorizer = ____

# Generate the tf-idf vectors for the corpus
tfidf_matrix = tfidf_vectorizer.fit_transform(____)

# Compute and print the cosine similarity matrix
cosine_sim = ____(____, tfidf_matrix)
print(cosine_sim)
Edytuj i uruchom kod