Vše dohromady (1)
V předchozích cvičeních sis vyzkoušel/a základy psaní vlastních funkcí. Naučil/a ses přidávat parametry do definic funkcí, vracet jednu nebo více hodnot pomocí n-tic a volat funkce, které jsi sám/sama definoval/a.
V tomto a následujícím cvičení všechny tyto koncepty propojíš a použiješ je na jednoduchý problém z oblasti datové vědy. Načteš datovou sadu a vytvoříš funkce pro získání základních poznatků z dat.
Cílem tohoto cvičení je zopakovat, jak načíst datovou sadu do DataFrame. Datová sada obsahuje data z Twitteru a ty budeš iterovat přes záznamy ve sloupci, abys sestavil/a slovník, ve kterém jsou klíče názvy jazyků a hodnoty počty tweetů v daném jazyce. Soubor tweets.csv je k dispozici v aktuálním pracovním adresáři.
Měj na paměti, že jde o reálná data z Twitteru, a proto existuje riziko, že mohou obsahovat vulgární nebo jinak nevhodný obsah (v tomto i v následujících cvičeních pracujících s reálnými daty z Twitteru).
Toto cvičení je součástí kurzu
Úvod do funkcí v Pythonu
Pokyny k cvičení
- Importuj balíček pandas s aliasem
pd. - Načti soubor
'tweets.csv'pomocí funkceread_csv()z knihovny pandas. Výsledný DataFrame ulož do proměnnédf. - Dokonči cyklus
fortak, aby iteroval přescol, tedy sloupec'lang'v DataFramedf. - Dokonči těla příkazů
if-elseuvnitř cyklu: pokud se klíč nachází ve slovníkulangs_count, přičti1k hodnotě odpovídající tomuto klíči, jinak přidej klíč dolangs_counta nastav jeho hodnotu na1. Ve svém kódu použij proměnnou cykluentry.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import pandas
# Import Twitter data as DataFrame: df
df = ____
# Initialize an empty dictionary: langs_count
langs_count = {}
# Extract column from DataFrame: col
col = df['lang']
# Iterate over lang column in DataFrame
for entry in ____:
# If the language is in langs_count, add 1
if entry in langs_count.keys():
____
# Else add the language to langs_count, set the value to 1
else:
____
# Print the populated dictionary
print(langs_count)