ПочатиПочніть безкоштовно

Матриця косинусної подібності для корпусу

У цій вправі вам надано corpus — список із п'яти речень. corpus виведено в консолі. Вам потрібно обчислити матрицю косинусної подібності, яка містить попарні значення косинусної подібності для кожної пари речень (векторизованих за допомогою tf-idf).

Пам'ятайте: значення на перетині i-го рядка та j-го стовпця матриці подібності позначає оцінку подібності для i-го та j-го векторів.

Ця вправа є частиною курсу

Інженерія ознак для NLP у Python

Переглянути курс

Інструкції до вправи

  • Ініціалізуйте екземпляр TfidfVectorizer. Назвіть його tfidf_vectorizer.
  • За допомогою fit_transform() згенеруйте tf-idf-вектори для corpus. Назвіть результат tfidf_matrix.
  • Використайте cosine_similarity() і передайте tfidf_matrix, щоб обчислити матрицю косинусної подібності cosine_sim.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Initialize an instance of tf-idf Vectorizer
tfidf_vectorizer = ____

# Generate the tf-idf vectors for the corpus
tfidf_matrix = tfidf_vectorizer.fit_transform(____)

# Compute and print the cosine similarity matrix
cosine_sim = ____(____, tfidf_matrix)
print(cosine_sim)
Редагувати та запускати код