Listomfattningar för tidsstämplad data
Nu får du använda dig av det du lärt dig i det här kapitlet för att lösa ett enkelt dataextraktionsproblem. Du introduceras också till en datastruktur, pandas Series, i den här övningen. Vi går inte in på djupet här, men det du behöver veta är att det är en datastruktur som du kommer att arbeta med ofta när du analyserar data från pandas DataFrames. Du kan tänka på DataFrame-kolumner som endimensionella arrayer kallade Series.
I den här övningen använder du en listomfattning för att extrahera tiden från tidsstämplad Twitter-data. Paketet pandas har importerats som pd och filen 'tweets.csv' har importerats som DataFrame:en df.
Den här övningen är en del av kursen
Python Toolbox
Övningsinstruktioner
- Extrahera kolumnen
'created_at'fråndfoch tilldela resultatet tilltweet_time. Kul fakta: den extraherade kolumnen itweet_timeär en Series-datastruktur! - Skapa en listomfattning som extraherar tiden från varje rad i
tweet_time. Varje rad är en sträng som representerar en tidsstämpel, och du hämtar tecknen på position 12 till 19 i strängen för att få ut tiden. Användentrysom iteratorvariabel och tilldela resultatet tilltweet_clock_time. Kom ihåg att Python använder 0-baserad indexering!
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Extract the created_at column from df: tweet_time
tweet_time = ____
# Extract the clock time: tweet_clock_time
tweet_clock_time = [____]
# Print the extracted times
print(tweet_clock_time)