ПочатиПочніть безкоштовно

Який штат найбільш дружній до ринків?

Досліджуючи дані про фермерські ринки, ви замислюєтеся, які шаблони з'являться, якщо агрегувати на рівні штатів. Чи деякі штати більш дружні до ринків, ніж інші? Щоб це перевірити, ви групуєте дані за штатом і отримуєте логарифмовану кількість ринків (log_markets) та чисельність населення штатів (log_pop).

markets_and_pop = (markets
    .groupby('state', as_index = False)
    .agg({
       'name': lambda d: log(len(d)),
       'state_pop': lambda d: log(d.iloc[0]) })
    .rename(columns = {
        'name': 'log_markets', 
        'state_pop': 'log_pop' }))

Для візуалізації ви вирішуєте використати регресійний графік, щоб оцінити «нормальний» зв'язок між кількістю ринків і населенням, а також текстову розсіяну діаграму, щоб швидко помітити цікаві викиди.

Ця вправа є частиною курсу

Удосконалення візуалізацій даних у Python

Переглянути курс

Інструкції до вправи

  • Ітеруйтеся рядками датафрейму markets_and_pop.
  • Розмістіть анотації поруч із відповідними точками на діаграмі розсіювання.
  • Зменшіть розмір тексту анотацій до 10 пунктів.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

g = sns.regplot(
    "log_markets", "log_pop", 
    ci = False,
    # Shrink scatter plot points
    scatter_kws = {'s':2},
    data = markets_and_pop)

# Iterate over the rows of the data
for _, row in markets_and_pop.____():
    state, _, _, log_markets, log_pop = row
    # Place annotation and reduce size for clarity
    g.annotate(state, (____,____), ____ = ____)

plt.show()
Редагувати та запускати код