Kom igångKom igång gratis

Bearbeta stora mängder Twitter-data

Ibland är den data vi behöver bearbeta för stor för att få plats i datorns minne. Det är ett vanligt problem inom datavetenskap. En lösning är att bearbeta en hel datakälla del för del, i stället för allt på en gång.

I den här övningen gör du just det. Du bearbetar en stor csv-fil med Twitter-data på samma sätt som du bearbetade 'tweets.csv' i övningarna Bringing it all together i föregångarkursen – men den här gången arbetar du med filen i delar om 10 poster i taget.

Om du är intresserad av att lära dig hur du kommer åt Twitter-data för att arbeta med den på ditt eget system kan du läsa Del 2 av DataCamps kurs om att importera data i Python.

Paketet pandas har importerats som pd och filen 'tweets.csv' finns i din nuvarande katalog.

Observera att det här är verklig data från Twitter, vilket innebär att den kan innehålla svordomar eller annat stötande innehåll (i den här övningen och eventuella efterföljande övningar som också använder verklig Twitter-data).

Den här övningen är en del av kursen

Python Toolbox

Visa kurs

Övningsinstruktioner

  • Initiera ett tomt lexikon counts_dict för att lagra resultaten från bearbetningen av Twitter-data.
  • Iterera över filen 'tweets.csv' med en for-loop. Använd loopvariabeln chunk och iterera över anropet till pd.read_csv() med ett chunksize på 10.
  • I den inre loopen itererar du över kolumnen 'lang' i chunk med en for-loop. Använd loopvariabeln entry.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Initialize an empty dictionary: counts_dict


# Iterate over the file chunk by chunk
for ____ in ____:

    # Iterate over the column in DataFrame
    for ____ in ____:
        if entry in counts_dict.keys():
            counts_dict[entry] += 1
        else:
            counts_dict[entry] = 1

# Print the populated dictionary
print(counts_dict)
Redigera och kör kod