Čistý tweet
Zpátky k projektu analýzy sentimentu na Twitteru! Existuje několik typů řetězců, které analýzu sentimentu komplikují – a přitom žádný užitečný sentiment nenesou. Patří mezi ně například odkazy a zmínky uživatelů.
Aby ses mohl/a pustit do čištění tweetů, chceš nejdřív extrahovat pár příkladů. Víš, že odkazy většinou začínají řetězcem http a neobsahují mezery, např. https://www.datacamp.com. Zmínky uživatelů začínají symbolem @ a mohou obsahovat pouze písmena a čísla, např. @johnsmith3.
Pro přehled si poznačíš užitečné kvantifikátory: * (nula nebo víckrát), + (jednou nebo víckrát), ? (nula nebo jednou).
Seznam sentiment_analysis obsahující text tří tweetů je už načtený v tvé session. Data si můžeš prohlédnout pomocí print() v IPython Shellu.
Toto cvičení je součástí kurzu
Regular Expressions in Python
Pokyny k cvičení
- Importuj modul
re. - Napiš regulární výraz, který v každém
tweetze seznamusentiment_analysisnajde všechny výskyty odkazů začínajícíchhttp. Výsledek vypiš. - Napiš regulární výraz, který v každém
tweetze seznamusentiment_analysisnajde všechny výskyty zmínek uživatelů. Výsledek vypiš.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import re module
____
for tweet in sentiment_analysis:
# Write regex to match http links and print out result
print(re.____(____"____", ____))
# Write regex to match user mentions and print out result
print(re.____(____"____", ____))