Začněte nyníZačněte zdarma

Čistý tweet

Zpátky k projektu analýzy sentimentu na Twitteru! Existuje několik typů řetězců, které analýzu sentimentu komplikují – a přitom žádný užitečný sentiment nenesou. Patří mezi ně například odkazy a zmínky uživatelů.

Aby ses mohl/a pustit do čištění tweetů, chceš nejdřív extrahovat pár příkladů. Víš, že odkazy většinou začínají řetězcem http a neobsahují mezery, např. https://www.datacamp.com. Zmínky uživatelů začínají symbolem @ a mohou obsahovat pouze písmena a čísla, např. @johnsmith3.

Pro přehled si poznačíš užitečné kvantifikátory: * (nula nebo víckrát), + (jednou nebo víckrát), ? (nula nebo jednou).

Seznam sentiment_analysis obsahující text tří tweetů je už načtený v tvé session. Data si můžeš prohlédnout pomocí print() v IPython Shellu.

Toto cvičení je součástí kurzu

Regular Expressions in Python

Zobrazit kurz

Pokyny k cvičení

  • Importuj modul re.
  • Napiš regulární výraz, který v každém tweet ze seznamu sentiment_analysis najde všechny výskyty odkazů začínajících http. Výsledek vypiš.
  • Napiš regulární výraz, který v každém tweet ze seznamu sentiment_analysis najde všechny výskyty zmínek uživatelů. Výsledek vypiš.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import re module
____

for tweet in sentiment_analysis:
	# Write regex to match http links and print out result
	print(re.____(____"____", ____))

	# Write regex to match user mentions and print out result
	print(re.____(____"____", ____))
Upravit a spustit kód