Исходный размер 2632x3644

No time to relax:

PROTECT STATUS: not protected

Описание проекта

Work–Life Balance and Longevity

Датасет:

Work-Life Balance and Longevity Dataset (10 000 строк, синтетические данные).

Источник:

Kaggle (Quality of Life Data).

Задача:

посмотреть, как распределение времени в сутках (работа, отдых, сон, спорт) связано с возрастом смерти.

Что я хочу получить в конце:

  1. гистограмма распределения возраста смерти
  2. boxplot по профессиям
  3. scatter (сон vs возраст смерти) + тренд
  4. тепловая карта корреляций
  5. stacked bar: средние часы (работа/отдых/сон/спорт) по профессиям
  6. «цена часа работы»: как меняется ожидаемый возраст смерти при +1 часу работы
  7. кластеризация образов жизни (режимы работы/сна)
big
Исходный размер 1536x1024

мудборд проекта, созданный с помощью нейросети ChatGPT.

Подготовка

big
Исходный размер 4392x1608

Работаем в Pandas, визуализация Matplotlib.

Загрузка данных

Исходный размер 4659x1712

Что лежит в таблице Ключевые поля:

  1. gender — пол
  2. occupation_type — тип профессии
  3. avg_work_hours_per_day, avg_rest_hours_per_day, avg_sleep_hours_per_day, avg_exercise_hours_per_day — средние часы в день
  4. age_at_death — возраст смерти

Проверки и обработка

Проверяю:

  1. пропуски
  2. дубликаты
  3. «правило суток»: сумма часов должна быть около 24

Дальше сделаю две версии данных:

  1. df — исходная таблица
  2. df_clean — строки, где сумма часов близка к 24
Исходный размер 2736x1592
Исходный размер 2736x2705
Исходный размер 2736x2383
Исходный размер 2736x1220

Статистические методы

Описательная статистика, чтобы понять диапазоны и типичные значения.

Корреляция Пирсона быстро показывает линейную связь между числовыми признаками.

t-test для сравнения двух групп (по полу). Проверяет, отличается ли средний age_at_death у двух групп.

ANOVA для сравнения нескольких групп (по профессиям). Проверяет, есть ли различия в среднем age_at_death между профессиями.

Полиномиальная регрессия (2-й степени) применяется для моделирования нелинейных зависимостей (например, между продолжительностью сна или рабочими часами и возрастом смерти).

Кластеризация K-means применяется для выделения устойчивых режимов образа жизни на основе времени работы и сна

Исходный размер 1329x698
Исходный размер 1329x488
Исходный размер 1329x418
Исходный размер 1329x229

Настройка оформления графиков

Для визуализации я использую только возможности Matplotlib: фон, линии, шрифт и сетку. Все параметры оформления задаются кодом, без постобработки.

При выборе стиля я опиралась на эстетику business punk, связанную с темой корпоративной среды, регламента и контроля. Такой визуальный язык хорошо подходит к данным о работе и распределении времени.

В качестве визуальных ориентиров использовались игра The Stanley Parable и сериал «Разделение» (Severance) — образы офисной среды, где работа становится замкнутой системой.

Исходный размер 1329x1289

Визуализации

Ниже — несколько разных типов графиков. Я строю их на df_clean, чтобы сумма часов была близка к 24.

Исходный размер 1318x1030
Исходный размер 889x490
Исходный размер 1318x883
Исходный размер 1089x590
No time to relax:
Проект создан 14.01.2026
Мы используем файлы cookies для улучшения работы сайта и большего удобства его использования. Более подробную информац...
Показать больше