Матриця косинусної подібності для корпусу
У цій вправі вам надано corpus — список із п'яти речень. corpus виведено в консолі. Вам потрібно обчислити матрицю косинусної подібності, яка містить попарні значення косинусної подібності для кожної пари речень (векторизованих за допомогою tf-idf).
Пам'ятайте: значення на перетині i-го рядка та j-го стовпця матриці подібності позначає оцінку подібності для i-го та j-го векторів.
Ця вправа є частиною курсу
Інженерія ознак для NLP у Python
Інструкції до вправи
- Ініціалізуйте екземпляр
TfidfVectorizer. Назвіть йогоtfidf_vectorizer. - За допомогою
fit_transform()згенеруйте tf-idf-вектори дляcorpus. Назвіть результатtfidf_matrix. - Використайте
cosine_similarity()і передайтеtfidf_matrix, щоб обчислити матрицю косинусної подібностіcosine_sim.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Initialize an instance of tf-idf Vectorizer
tfidf_vectorizer = ____
# Generate the tf-idf vectors for the corpus
tfidf_matrix = tfidf_vectorizer.fit_transform(____)
# Compute and print the cosine similarity matrix
cosine_sim = ____(____, tfidf_matrix)
print(cosine_sim)