Dopasowywanie i dzielenie
Niektóre tweety w twoim zbiorze danych zostały pobrane niepoprawnie. Zamiast spacji do oddzielania słów zawierają dziwne znaki. Postanawiasz użyć wyrażeń regularnych, aby poradzić sobie z tym problemem. Wyświetlasz kilka tweetów, żeby zrozumieć, jaki wzorzec musisz dopasować.
Zauważasz, że zdania są zawsze oddzielone znakiem specjalnym, po którym następuje cyfra, słowo break i kolejny znak specjalny, np. &4break!. Słowa są zawsze oddzielone znakiem specjalnym, słowem new i jednym losowym zwykłym znakiem, np. #newH.
Zmienna sentiment_analysis zawierająca tekst jednego tweeta oraz moduł re zostały już wczytane do twojej sesji. Możesz użyć print(sentiment_analysis), aby wyświetlić zawartość zmiennej w powłoce IPython.
To ćwiczenie jest częścią kursu
Wyrażenia regularne w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Write a regex to match pattern separating sentences
regex_sentence = ____"____"