시작하기무료로 시작하기

가짜 뉴스에서의 명사 사용

이 연습 문제에서는 가짜 또는 진짜로 분류된 뉴스 헤드라인이 담긴 데이터프레임 headlines가 제공됩니다. 여러분의 과제는 headlinestitle 피처에 포함된 고유 명사와 일반 명사의 개수를 나타내는 두 개의 새 피처 num_propnnum_noun을 생성하는 것입니다.

다음으로, 가짜 뉴스와 진짜 뉴스 헤드라인에서 사용된 고유 명사와 일반 명사의 평균 개수를 계산하고 값을 비교하겠습니다. 큰 차이가 있다면, 가짜 뉴스 탐지기에 num_propnnum_noun 피처를 사용했을 때 성능이 향상될 가능성이 높습니다.

이 작업을 수행하기 위해, 이전 연습 문제에서 여러분이 작성했던 함수 proper_nounsnouns가 이미 제공되어 있습니다.

이 연습은 강의의 일부입니다

Python으로 배우는 NLP 피처 엔지니어링

강의 보기

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

headlines[____] = headlines['title'].apply(____)

# Compute mean of proper nouns
real_propn = headlines[headlines['label'] == 'REAL']['num_propn'].mean()
fake_propn = headlines[headlines['label'] == 'FAKE']['num_propn'].____

# Print results
print("Mean no. of proper nouns in real and fake headlines are %.2f and %.2f respectively"%(real_propn, fake_propn))
코드 편집 및 실행