Научный доклад на студенческой конференции — пример презентации с результатами
Речь к слайду
- Тема: прогноз суточного спроса на велопрокат
- Кафедра прикладной информатики, Казань, 2026
- Собственный вычислительный эксперимент, данные 2023–2025
- Дальше — почему прокату важен прогноз на завтра
Добрый день, уважаемые члены жюри и коллеги. Тема моего доклада — сравнение методов прогнозирования суточного спроса на городской велопрокат. Работа выполнена на кафедре прикладной информатики, научный руководитель — кандидат технических наук, доцент. В основе доклада — собственный вычислительный эксперимент на открытых данных о поездках за 2023–2025 годы. Название проката и имена в работе вымышленные, а результаты носят учебный характер.
Недооценка спроса в утренний и вечерний пик оборачивается пустыми стойками и потерянными поездками пользователей.
Переоценка спроса — лишними велосипедами на станциях и лишними перевозками при перебалансировке.
Ошибка прогноза ведёт к простою техники, сорванным поездкам и росту затрат на ручную перебалансировку.
Прокат не может мгновенно перераспределить велосипеды: решение о развозке по станциям и плане ремонта принимается накануне, а ошибка прогноза напрямую превращается в простой техники, сорванные поездки и рост затрат на ручную перебалансировку.
Речь к слайду
- Решение о развозке принимается накануне
- Недооценка — пустые стойки и потерянные поездки
- Переоценка — простой техники и лишние перевозки
- Дальше — цель работы и три задачи
Прокат живёт по расписанию: велосипеды развозят по станциям заранее, накануне, и утром уже поздно что-то менять. Если мы недооценили спрос, в пик стойки пустые, а поездки, которые могли состояться, просто теряются. Если переоценили — техника стоит без дела, а оператор платит за лишние перевозки при перебалансировке. Именно поэтому вопрос «сколько будет поездок завтра» — не академический, а операционный. Дальше я покажу, как мы поставили цель и какие три задачи для этого решили.
Данные городского проката за 2023–2025 годы: 1 096 суточных записей с признаками «день недели», «праздник», «температура», «осадки».
Три метода и единая схема: обучение на 2023–2024 годах, проверка на данных 2025 года, скользящая проверка по пяти блокам.
Сравнение по метрикам MAE и MAPE и определение условий, где прогноз ошибается сильнее всего.
Речь к слайду
- Цель — сравнить три метода на отложенном периоде
- Задача 1: 1 096 суточных записей за 2023–2025
- Задача 2: обучение 2023–2024, проверка 2025
- Задача 3: MAE и MAPE, слабые места прогноза
Итак, цель работы — сравнить три метода прогнозирования суточного спроса на городской велопрокат по качеству на отложенном периоде. Для этого нужно решить три задачи. Первая — собрать и подготовить данные проката за 2023–2025 годы: это 1 096 суточных записей с признаками «день недели», «праздник», «температура» и «осадки». Вторая — реализовать три метода и единую схему проверки: обучение на 2023–2024 годах, проверка на данных 2025 года и скользящая проверка по пяти блокам. Третья — сравнить методы по метрикам MAE и MAPE и понять, в каких условиях прогноз ошибается сильнее всего. Именно на этих трёх задачах построена вся дальнейшая логика доклада.
Речь к слайду
- 1 096 суточных записей за 2023–2025
- Целевая переменная — поездки за сутки
- 4 признака: день недели, праздник, температура, осадки
- Праздничных дней ≈3% — источник ошибок
Для эксперимента я взял открытый набор наблюдений городского велопроката за 2023–2025 годы — всего 1 096 суточных записей, то есть по одной строке на каждый день. Целевая переменная — число поездок за сутки, именно её мы и будем прогнозировать. В качестве признаков используются четыре характеристики: день недели, признак праздника, температура воздуха и количество осадков. Праздничные дни в выборке составляют небольшую долю — около трёх процентов, но, как увидим дальше, именно они дают наибольшие ошибки. Это учебный эксперимент, поэтому название проката и имена условные, а данные не являются официальной статистикой.
Данные 2023–2024 годов: день недели, праздник, температура, осадки. Настройка параметров каждого метода.
Отложенная выборка 2025 года — модель не видела эти наблюдения при обучении.
Пять блоков последовательной проверки: обучение на прошлом, прогноз на следующем интервале.
Отклонение прогноза от факта: абсолютная ошибка в поездках (MAE) и относительная в процентах (MAPE).
Речь к слайду
- Обучение — 2023–2024, проверка — 2025
- Скользящая проверка: пять блоков
- Ошибка: MAE в поездках, MAPE в процентах
- Все методы — на одних разбиениях
Перехожу к методике. Обучение я проводил на данных 2023 и 2024 годов, а проверку — на 2025 годе, который модели при обучении не видели. Дополнительно сделал скользящую проверку по пяти блокам: это устойчивее, чем одна отложенная выборка. Ошибкой я считал отклонение прогноза от факта — в поездках и в процентах. Важный момент: все три метода считались на одних и тех же разбиениях, иначе сравнивать их было бы некорректно. Теперь посмотрим, какие именно методы я сравнивал.
Базовый метод без признаков: прогноз равен среднему спросу за прошлую неделю. Прост в расчёте и служит точкой отсчёта. Ограничение — не учитывает погоду, праздники и тренд, поэтому сглаживает пики и провалы.
На входе — температура, осадки, день недели и признак праздника. Модель прозрачна, коэффициенты объяснимы. Ограничение — улавливает лишь линейные связи.
Ансамбль деревьев решений, улавливающий нелинейные зависимости спроса от погоды и календаря. На входе те же признаки, что и у регрессии. Ограничение — риск переобучения и меньшая прозрачность модели.
Речь к слайду
- Три метода — разная сложность модели
- Скользящее среднее — базовая линия без признаков
- Регрессия и бустинг — те же признаки на входе
- Бустинг ловит нелинейные пороги погоды
- Дальше — метрики MAE и MAPE
Итак, мы сравнили три метода, которые отличаются прежде всего тем, сколько информации о мире они используют. Скользящее среднее — это честная базовая линия: оно просто берёт средний спрос за прошлую неделю и ничего больше не знает. Линейная регрессия уже получает на вход температуру, осадки, день недели и праздники, поэтому может объяснить часть колебаний, но только если связь линейна. Градиентный бустинг работает с теми же признаками, но строит ансамбль деревьев и способен уловить нелинейные эффекты — например, что спрос резко падает не при любой температуре, а при переходе через определённый порог. Именно эти три модели мы и прогнали через один и тот же протокол проверки, о результатах которого поговорим дальше.
Речь к слайду
- MAE — в поездках, MAPE — в процентах
- y_i — факт, ŷ_i — прогноз, n — число суток
- MAPE позволяет сравнивать методы между собой
- дальше — результаты трёх методов
Прежде чем сравнивать методы, нужно договориться, чем мы измеряем ошибку. MAE — это средняя абсолютная ошибка в поездках: она показывает, на сколько в среднем мы промахиваемся в натуральных единицах спроса. MAPE — та же ошибка, но отнесённая к фактическому значению и выраженная в процентах, поэтому она позволяет сопоставлять методы между собой и не зависит от масштаба проката. В нашем эксперименте y_i — фактический спрос за сутки, ŷ_i — прогноз модели, n — число суток проверочного 2025 года. Обе метрики считаются на одном и том же наборе наблюдений, поэтому их значения напрямую сравнимы. Дальше я покажу, как на этих двух метриках разошлись три метода.
Речь к слайду
- Главное — MAPE бустинга 9,7 %
- Погода даёт 4,3 п.п.: 18,4 → 14,1
- Нелинейность ещё 4,4 п.п.: 14,1 → 9,7
- Дальше — где модели промахиваются
Переходим к главному — результатам на проверочном 2025 годе. Скользящее среднее дало MAPE 18,4 процента и MAE 214 поездок, линейная регрессия с погодными признаками — 14,1 процента и 163 поездки, а градиентный бустинг — 9,7 процента и 112 поездок. Смотрите, как раскладывается выигрыш: добавление погоды снижает ошибку на 4,3 процентного пункта, а учёт нелинейности даёт ещё 4,4 пункта. Итого бустинг точнее простого среднего на 8,7 процентного пункта по MAPE и почти вдвое по абсолютной ошибке. Дальше посмотрим, где именно модели промахиваются сильнее всего.
Минимальная ошибка: модель работает устойчиво, режим поездок предсказуем и хорошо представлен в обучающей выборке 2023–2024 годов.
Умеренный рост ошибки: похолодание или дождь смещают спрос, но будний профиль поездок частично компенсирует отклонение.
Заметный промах: нетипичный профиль праздника слабо представлен в данных, модель недооценивает спрос даже при хорошей погоде.
Максимальный MAPE: сочетание редкое в обучении, поведение пользователей нетипично, модель сильнее всего недооценивает спрос.
Речь к слайду
- Две оси: тип дня и погода
- Минимум ошибки — обычный день, ровная погода
- Максимум MAPE — праздник плюс резкая смена погоды
- Причина — мало таких примеров в обучении
Теперь посмотрим, где именно наша модель ошибается сильнее всего. Я разложил все дни проверочного 2025 года по двум осям: тип дня — обычный или праздничный, и погода — стабильная или с резкой сменой. Видно чёткую закономерность: минимальная ошибка там, где всё предсказуемо — обычный день и ровная погода. А максимальный MAPE — в правом верхнем квадранте, где праздник совпадает с резкой сменой погоды. Причина простая: таких сочетаний в обучающей выборке 2023–2024 годов совсем мало, и поведение людей в них нетипично — модель просто не видела достаточно похожих примеров. Именно этот квадрант — главный резерв для улучшения прогноза.
Эксперимент проведён на данных одного города. Переносить найденные закономерности на другие города без повторной проверки нельзя: структура поездок и климат там иные.
В распоряжении 2023–2025 годы — 1 096 суточных записей. Редких сочетаний «праздник + плохая погода» в выборке мало, поэтому именно на них модель обучена слабее всего.
В модель подавались фактические температура и осадки. В реальном режиме «прогноз на завтра» доступен только прогноз погоды, поэтому ошибка будет выше полученных 9,7–18,4 %.
Учтены только календарь и погода. Не вошли тарифы, ремонты станций, городские события и загруженность соседних станций — часть ошибок объясняется именно этим.
Речь к слайду
- Честно о границах: чего результаты не доказывают
- Один город, три года, 1 096 записей
- Мало примеров «праздник + плохая погода»
- Погода фактическая, не прогнозная — ошибка будет выше
- Дальше — выводы и планы на 2027 год
Теперь честно о том, чего наши результаты не доказывают. Мы работали с одним городом и тремя годами наблюдений — это 1 096 суточных записей, и редких сочетаний «праздник плюс плохая погода» в них совсем немного, поэтому именно там модель ошибается чаще всего. Второе важное ограничение: погоду мы подавали фактическую, а не прогнозную, а в реальной задаче «прогноз на завтра» доступен только прогноз погоды — значит, на практике ошибка будет выше наших 9,7–18,4 процента. И третье: набор признаков ограничен календарём и погодой, без тарифов, ремонтов станций и городских событий. Отсюда и планы: расширить признаки и перейти на прогнозную погоду.
1. Градиентный бустинг даёт лучший результат: MAPE 9,7 % и MAE 112 поездок против 14,1 % / 163 у линейной регрессии и 18,4 % / 214 у скользящего среднего.
2. Календарно-погодные признаки и нелинейность модели дают основной выигрыш в точности прогноза суточного спроса.
3. Добавить второй город, перейти на прогнозную погоду вместо фактической и расширить набор признаков.
4. Открытый набор наблюдений городского велопроката за 2023–2025 годы, 1 096 суточных записей (учебный эксперимент).
5. Работа по градиентному бустингу: описание алгоритма и настройки гиперпараметров для задач регрессии.
6. Руководство по метрикам качества прогноза MAE и MAPE: формулы и интерпретация значений.
7. Исследование по прогнозированию спроса на городской велопрокат с учётом погоды и календаря.
Контакт: кафедра прикладной информатики
Вопросы: Благодарю за внимание! Готов ответить на вопросы.
Речь к слайду
- Лучший метод — градиентный бустинг
- MAPE 9,7 % и MAE 112 поездок
- Линейная регрессия 14,1 % / 163, среднее 18,4 % / 214
- Планы 2027: второй город, прогнозная погода
- Благодарю за внимание
Подведу итог. Лучший результат показал градиентный бустинг — MAPE 9,7 процента и MAE 112 поездок, тогда как линейная регрессия дала 14,1 процента и 163 поездки, а скользящее среднее — 18,4 процента и 214 поездок. Основной выигрыш приносят календарно-погодные признаки и способность модели улавливать нелинейные зависимости. На 2027 год планирую добавить второй город, перейти на прогнозную погоду вместо фактической и расширить набор признаков. Список использованных источников — на слайде, данные и код эксперимента доступны по запросу. Благодарю за внимание и готов ответить на вопросы.