Bearbeta stora mängder Twitter-data
Ibland är den data vi behöver bearbeta för stor för att få plats i datorns minne. Det är ett vanligt problem inom datavetenskap. En lösning är att bearbeta en hel datakälla del för del, i stället för allt på en gång.
I den här övningen gör du just det. Du bearbetar en stor csv-fil med Twitter-data på samma sätt som du bearbetade 'tweets.csv' i övningarna Bringing it all together i föregångarkursen – men den här gången arbetar du med filen i delar om 10 poster i taget.
Om du är intresserad av att lära dig hur du kommer åt Twitter-data för att arbeta med den på ditt eget system kan du läsa Del 2 av DataCamps kurs om att importera data i Python.
Paketet pandas har importerats som pd och filen 'tweets.csv' finns i din nuvarande katalog.
Observera att det här är verklig data från Twitter, vilket innebär att den kan innehålla svordomar eller annat stötande innehåll (i den här övningen och eventuella efterföljande övningar som också använder verklig Twitter-data).
Den här övningen är en del av kursen
Python Toolbox
Övningsinstruktioner
- Initiera ett tomt lexikon
counts_dictför att lagra resultaten från bearbetningen av Twitter-data. - Iterera över filen
'tweets.csv'med enfor-loop. Använd loopvariabelnchunkoch iterera över anropet tillpd.read_csv()med ettchunksizepå 10. - I den inre loopen itererar du över kolumnen
'lang'ichunkmed enfor-loop. Använd loopvariabelnentry.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Initialize an empty dictionary: counts_dict
# Iterate over the file chunk by chunk
for ____ in ____:
# Iterate over the column in DataFrame
for ____ in ____:
if entry in counts_dict.keys():
counts_dict[entry] += 1
else:
counts_dict[entry] = 1
# Print the populated dictionary
print(counts_dict)