ÎncepețiÎncepe gratuit

Utilizarea substantivelor în știrile false

În acest exercițiu, ți s-a pus la dispoziție un dataframe headlines care conține titluri de știri – fie false, fie reale. Sarcina ta este să generezi două caracteristici noi, num_propn și num_noun, care să reprezinte numărul de substantive proprii și, respectiv, numărul celorlalte substantive din coloana title a dataframe-ului headlines.

În continuare, vom calcula media substantivelor proprii și a celorlalte substantive folosite în titlurile știrilor false și reale, comparând valorile obținute. Dacă există o diferență semnificativă, există șanse mari ca utilizarea caracteristicilor num_propn și num_noun în detectoarele de știri false să le îmbunătățească performanța.

Pentru a duce la bun sfârșit această sarcină, funcțiile proper_nouns și nouns pe care le-ai construit în exercițiul anterior îți sunt deja disponibile.

Acest exercițiu face parte din cursul

Ingineria caracteristicilor pentru NLP în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

headlines[____] = headlines['title'].apply(____)

# Compute mean of proper nouns
real_propn = headlines[headlines['label'] == 'REAL']['num_propn'].mean()
fake_propn = headlines[headlines['label'] == 'FAKE']['num_propn'].____

# Print results
print("Mean no. of proper nouns in real and fake headlines are %.2f and %.2f respectively"%(real_propn, fake_propn))
Editează și rulează codul