Cách dùng danh từ trong tin giả
Trong bài tập này, bạn được cung cấp một dataframe headlines chứa các tiêu đề tin tức là giả hoặc thật. Nhiệm vụ của bạn là tạo hai đặc trưng mới num_propn và num_noun biểu thị số lượng danh từ riêng và các danh từ khác có trong trường title của headlines.
Tiếp theo, bạn sẽ tính số trung bình của danh từ riêng và các danh từ khác được dùng trong tiêu đề tin giả và tin thật rồi so sánh các giá trị này. Nếu có sự khác biệt đáng kể, rất có thể việc dùng các đặc trưng num_propn và num_noun trong bộ phát hiện tin giả sẽ cải thiện hiệu năng của mô hình.
Để hoàn thành nhiệm vụ, các hàm proper_nouns và nouns mà bạn đã xây dựng ở bài trước đã được cung cấp sẵn cho bạn.
Bài tập này là một phần của khóa học
Khai thác đặc trưng cho NLP bằng Python
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
headlines[____] = headlines['title'].apply(____)
# Compute mean of proper nouns
real_propn = headlines[headlines['label'] == 'REAL']['num_propn'].mean()
fake_propn = headlines[headlines['label'] == 'FAKE']['num_propn'].____
# Print results
print("Mean no. of proper nouns in real and fake headlines are %.2f and %.2f respectively"%(real_propn, fake_propn))