Procesarea unui volum mare de date Twitter
Uneori, datele pe care trebuie să le procesăm depășesc capacitatea memoriei unui calculator. Aceasta este o problemă frecventă cu care se confruntă specialiștii în date. O soluție este să procesezi întreaga sursă de date fragment cu fragment, în loc să o tratezi dintr-o singură trecere.
În acest exercițiu vei face exact asta. Vei procesa un fișier csv mare cu date Twitter în același mod în care ai procesat 'tweets.csv' în exercițiile Bringing it all together din cursul precedent, dar de data aceasta lucrând pe fragmente de câte 10 intrări.
Dacă ești interesat să afli cum poți accesa datele Twitter pentru a lucra cu ele pe propriul sistem, consultă Partea 2 a cursului DataCamp despre importul datelor în Python.
Pachetul pandas a fost importat ca pd, iar fișierul 'tweets.csv' se află în directorul tău curent.
Reține că acestea sunt date reale de pe Twitter și, prin urmare, există întotdeauna riscul ca acestea să conțină limbaj vulgar sau alt conținut ofensator (în acest exercițiu și în orice exerciții ulterioare care folosesc tot date reale de pe Twitter).
Acest exercițiu face parte din cursul
Cutia cu instrumente Python
Instrucțiuni pentru exercițiu
- Inițializează un dicționar gol
counts_dictpentru a stoca rezultatele procesării datelor Twitter. - Iterează peste fișierul
'tweets.csv'folosind o buclăfor. Folosește variabila de buclăchunkși iterează peste apelul funcțieipd.read_csv()cu unchunksizede 10. - În bucla interioară, iterează peste coloana
'lang'dinchunkfolosind o buclăfor. Folosește variabila de buclăentry.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Initialize an empty dictionary: counts_dict
# Iterate over the file chunk by chunk
for ____ in ____:
# Iterate over the column in DataFrame
for ____ in ____:
if entry in counts_dict.keys():
counts_dict[entry] += 1
else:
counts_dict[entry] = 1
# Print the populated dictionary
print(counts_dict)