Przetwarzanie dużych zbiorów danych z Twittera
Czasami dane, które trzeba przetworzyć, są zbyt duże, by zmieścić je w pamięci komputera. To częsty problem, z którym mierzą się data scientists. Rozwiązaniem jest przetwarzanie danych partiami (ang. chunk by chunk), zamiast wczytywania ich wszystkich naraz.
W tym ćwiczeniu zrobisz dokładnie to. Przetworzysz duży plik CSV z danymi z Twittera – podobnie jak plik 'tweets.csv' w ćwiczeniach Bringing it all together z kursu poprzedzającego ten – tym razem jednak pracując na fragmentach po 10 wierszy.
Jeśli chcesz dowiedzieć się, jak samodzielnie pobierać dane z Twittera, zajrzyj do części 2 kursu DataCamp dotyczącego importowania danych w Pythonie.
Biblioteka pandas została zaimportowana jako pd, a plik 'tweets.csv' znajduje się w twoim bieżącym katalogu.
Pamiętaj, że są to prawdziwe dane z Twittera – istnieje więc ryzyko, że mogą zawierać wulgaryzmy lub inne treści nieodpowiednie (dotyczy to tego ćwiczenia oraz kolejnych ćwiczeń korzystających z rzeczywistych danych z Twittera).
To ćwiczenie jest częścią kursu
Zestaw narzędzi Pythona
Instrukcje do ćwiczenia
- Zainicjuj pusty słownik
counts_dict, w którym będziesz przechowywać wyniki przetwarzania danych z Twittera. - Iteruj po pliku
'tweets.csv'za pomocą pętlifor. Użyj zmiennej pętlichunki iteruj po wywołaniupd.read_csv()z wartościąchunksizerówną 10. - W wewnętrznej pętli iteruj po kolumnie
'lang'wchunk, używając pętliforze zmiennąentry.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Initialize an empty dictionary: counts_dict
# Iterate over the file chunk by chunk
for ____ in ____:
# Iterate over the column in DataFrame
for ____ in ____:
if entry in counts_dict.keys():
counts_dict[entry] += 1
else:
counts_dict[entry] = 1
# Print the populated dictionary
print(counts_dict)