Zacznij terazZacznij za darmo

Który stan jest najbardziej przyjazny targowiskom?

Podczas eksploracji danych o targowiskach zastanawiasz się, jakie wzorce mogą pojawić się po agregacji do poziomu stanów. Czy niektóre stany są bardziej przyjazne targowiskom niż inne? Aby to zbadać, grupujesz dane według stanu i obliczasz logarytmiczną liczbę targowisk (log_markets) oraz logarytmiczną liczbę mieszkańców stanu (log_pop).

markets_and_pop = (markets
    .groupby('state', as_index = False)
    .agg({
       'name': lambda d: log(len(d)),
       'state_pop': lambda d: log(d.iloc[0]) })
    .rename(columns = {
        'name': 'log_markets', 
        'state_pop': 'log_pop' }))

Aby zwizualizować dane, decydujesz się użyć wykresu regresji – by zobaczyć „typową" zależność między liczbą targowisk a liczbą mieszkańców – oraz wykresu tekstowego, który pomoże szybko zidentyfikować interesujące wartości odstające.

To ćwiczenie jest częścią kursu

Ulepszanie wizualizacji danych w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Iteruj po wierszach ramki danych markets_and_pop.
  • Umieść adnotacje obok odpowiadających im punktów na wykresie rozrzutu.
  • Zmniejsz rozmiar tekstu adnotacji do 10 punktów.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

g = sns.regplot(
    "log_markets", "log_pop", 
    ci = False,
    # Shrink scatter plot points
    scatter_kws = {'s':2},
    data = markets_and_pop)

# Iterate over the rows of the data
for _, row in markets_and_pop.____():
    state, _, _, log_markets, log_pop = row
    # Place annotation and reduce size for clarity
    g.annotate(state, (____,____), ____ = ____)

plt.show()
Edytuj i uruchom kod