ВВЕДЕНИЕ
В данном анализе представлены визуализации данных о распространении COVID-19, адаптированные для изучения эпидемиологических показателей. Графики демонстрируют распределение случаев заражения, смертности и выздоровления по регионам, временным периодам и демографическим характеристикам.
Код автоматически адаптируется под структуру загруженного датасета https://www.kaggle.com/datasets/shraddha4ever20/covid-19-patient-symptoms-and-diagnosis-dataset, определяя подходящие колонки для количественных метрик (Cases, Confirmed, Deaths, Recovered) и категориальных признаков (Country_Region, Province_State, Gender, Date).
АКТУАЛЬНОСТЬ
Анализ данных о COVID-19 остается крайне важным в 2025 году, несмотря на завершение активной фазы пандемии. Понимание динамики распространения вируса необходимо для подготовки к будущим вспышкам, понимания эффективности мер защиты и разработки постпандемических действий здравоохранения.
ПОЧЕМУ Я ВЫБРАЛА ЭТУ ТЕМУ?
Поскольку тема является не самой лёгкой, но очень важной для общества и нашего будущего, я выбрала эту тему для того, чтобы рассказать о ситуации подробно. Но оформить ее наиболее приятным способом, чтобы воспринимать информацию было проще. Также анализ данных может быть интересен, потому что содержит научную и практическую ценность, эпидемиологическую статистику и отслеживание динамики распространения.
ВИДЫ ГРАФИКОВ
Для проекта были выбраны разные типы визуализаций: гистограмма, круговая диаграмма, горизонтальная столбчатая диаграмма, тепловая таблица, пузырьковая диаграмма.
ПАЛИТРА
Для графиков использованы цвета 344E41, 588157, A3B18A, DAD7CD и похожие, что позволило добиться визуальной целостности и читаемости инфографики. Также они позитивно влияют на восприятие информации, глядя на нежные оттенки зелёного, появляется ощущение безопасности.
РАБОТА С ДАННЫМИ
Для работы с данными были подключены библиотеки: Kaggle и Pandas — для анализа, Google Colab — для визуализации и Perplexity — для помощи.
Данные были загружены с компьютера и прочитаны с помощью pandas. Для первичного анализа были выведены первые строки, типы данных и базовая статистика.
ГРАФИК № 1
Столбчатый график демонстрирует распределение данных по 15 основным категориям в наборе данных о COVID-19.
Видно, что распределение случаев по регионам неравномерно. Несмотря на наличие 81 региона, большинство случаев (89.8%) сконцентрировано за пределами наиболее поражённых областей, что указывает на формирование локальных источников инфекции.
ГРАФИК № 2
Эта программа создает круговую диаграмму, показывающую распределение случаев COVID-19 по регионам. Также выявляет регионы с наибольшей нагрузкой и наглядно представляет долю значимых регионов по сравнению с остальными.
Код plt.pie() является главным, потому что он трансформирует данные в визуальную форму (цифры в график) и определяет тип визуализации. Без него вся программа теряет смысл.
Существует значительный разброс в количестве случаев между регионами (от 5 до 85). Среднее значение (23.3) существенно ниже максимума, а стандартное отклонение сопоставимо со средним.
ГРАФИК № 3
Данный код сравнивает три ключевые статистические меры (среднее, максимум и минимум) из набора данных об эпидемии, визуализируя их в виде горизонтальных столбцов разного цвета.
Превращает вычисленные числа (mean_val, max_val, min_val) в структурированный набор для визуализации sns.barplot() — функция, которая непосредственно рисует столбцы на графике Все остальное (оформление, подписи, легенда) — это "упаковка" вокруг этих двух строк




