NMF học các chủ đề của tài liệu
Trong video, bạn đã học rằng khi áp dụng NMF cho tài liệu, các thành phần sẽ tương ứng với các chủ đề, và các đặc trưng NMF sẽ tái tạo tài liệu từ các chủ đề đó. Hãy tự kiểm chứng điều này với mô hình NMF mà bạn đã xây dựng trước đó bằng các bài viết Wikipedia. Trước đó, bạn thấy giá trị đặc trưng NMF thứ 3 cao đối với các bài viết về diễn viên Anne Hathaway và Denzel Washington. Trong bài này, hãy xác định chủ đề của thành phần NMF tương ứng.
Mô hình NMF bạn đã xây dựng trước đó có sẵn dưới tên model, còn words là danh sách các từ dùng để đặt nhãn cho các cột của mảng tần suất từ.
Sau khi hoàn thành, hãy dành chút thời gian để nhận ra chủ đề chung giữa các bài viết về Anne Hathaway và Denzel Washington!
Bài tập này là một phần của khóa học
Unsupervised Learning bằng Python
Hướng dẫn bài tập
- Import
pandasvới bí danhpd. - Tạo một DataFrame
components_dftừmodel.components_, đặtcolumns=wordsđể các cột được gắn nhãn bằng các từ. - In
components_df.shapeđể kiểm tra kích thước của DataFrame. - Dùng bộ truy cập
.iloc[]trên DataFramecomponents_dfđể chọn hàng3. Gán kết quả chocomponent. - Gọi phương thức
.nlargest()củacomponentvà in kết quả. Điều này sẽ cho ra 5 từ có giá trị cao nhất cho thành phần đó.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import pandas
import pandas as pd
# Create a DataFrame: components_df
components_df = ____
# Print the shape of the DataFrame
print(components_df.shape)
# Select row 3: component
component = ____
# Print result of nlargest
print(component.nlargest())