ÎncepețiÎncepe gratuit

Procesarea unui volum mare de date Twitter

Uneori, datele pe care trebuie să le procesăm depășesc capacitatea memoriei unui calculator. Aceasta este o problemă frecventă cu care se confruntă specialiștii în date. O soluție este să procesezi întreaga sursă de date fragment cu fragment, în loc să o tratezi dintr-o singură trecere.

În acest exercițiu vei face exact asta. Vei procesa un fișier csv mare cu date Twitter în același mod în care ai procesat 'tweets.csv' în exercițiile Bringing it all together din cursul precedent, dar de data aceasta lucrând pe fragmente de câte 10 intrări.

Dacă ești interesat să afli cum poți accesa datele Twitter pentru a lucra cu ele pe propriul sistem, consultă Partea 2 a cursului DataCamp despre importul datelor în Python.

Pachetul pandas a fost importat ca pd, iar fișierul 'tweets.csv' se află în directorul tău curent.

Reține că acestea sunt date reale de pe Twitter și, prin urmare, există întotdeauna riscul ca acestea să conțină limbaj vulgar sau alt conținut ofensator (în acest exercițiu și în orice exerciții ulterioare care folosesc tot date reale de pe Twitter).

Acest exercițiu face parte din cursul

Cutia cu instrumente Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Inițializează un dicționar gol counts_dict pentru a stoca rezultatele procesării datelor Twitter.
  • Iterează peste fișierul 'tweets.csv' folosind o buclă for. Folosește variabila de buclă chunk și iterează peste apelul funcției pd.read_csv() cu un chunksize de 10.
  • În bucla interioară, iterează peste coloana 'lang' din chunk folosind o buclă for. Folosește variabila de buclă entry.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Initialize an empty dictionary: counts_dict


# Iterate over the file chunk by chunk
for ____ in ____:

    # Iterate over the column in DataFrame
    for ____ in ____:
        if entry in counts_dict.keys():
            counts_dict[entry] += 1
        else:
            counts_dict[entry] = 1

# Print the populated dictionary
print(counts_dict)
Editează și rulează codul