Нерегулярные временные ряды: почему MSE устарела?
Прогнозирование нерегулярных временных рядов — задача, которая встречается повсюду: от финансовых транзакций до данных медицинских датчиков. В таких рядах наблюдения поступают не через равные интервалы, а хаотично, с пропусками и сгущениями. На первый взгляд может показаться, что главная проблема здесь — построить умную модель, способную справиться с неравномерностью данных. Однако, как показывает свежая работа исследователей из arXiv (препринт 2608.17293), существует более фундаментальная проблема: мы просто неправильно оцениваем качество этих моделей.
Невидимая ошибка измерения
На протяжении многих лет стандартом де-факто для оценки качества прогнозирования является среднеквадратичная ошибка (MSE). Логика проста: чем меньше разница между предсказанием и фактом, тем лучше. Но эта логика рушится, когда речь идет о нерегулярных временных рядах.
Дьявол кроется в деталях: MSE измеряет ошибку только в те моменты времени, когда в данных есть фактические наблюдения. В нерегулярных рядах эти моменты распределены крайне неравномерно. Получается, что итоговая метрика сильно зависит не от того, насколько хорошо модель понимает процесс, а от того, как именно были расставлены точки измерения в конкретной выборке.
Представьте себе двух врачей, которые измеряют давление пациента. Один делает замеры каждые 15 минут, другой — несколько раз в день. При этом само давление меняется постоянно. Если мы оценим точность предсказаний, сравнивая их только с точками замеров, результаты будут сильно различаться просто из-за разной частоты измерений, а не из-за реального качества прогноза. Авторы статьи называют это смещённой оценкой — модель может показывать отличный MSE на одном наборе данных и провальный на другом, просто потому что временные метки в них распределены по-другому.

Именно поэтому MSE в данном контексте измеряет не столько «предсказательную силу» алгоритма, сколько конкретную конфигурацию временных меток в тестовой выборке.
CSE: попытка заглянуть за временные метки
Решение, предложенное в исследовании, называется Continuous-time Squared Error (CSE). Идея метрики элегантна: вместо того чтобы сравнивать предсказания и факты только в дискретных точках наблюдений, CSE пытается оценить ошибку модели в непрерывном времени.
Как это работает? Ключевой механизм — важность взвешивания (importance weighting). Каждая точка наблюдения получает вес, обратно пропорциональный плотности выборки временных меток в её окрестности. Если в каком-то промежутке времени замеров очень много, каждый конкретный замер вносит меньший вклад в общую оценку. Если же замеры редки, их вес возрастает. Это позволяет «сгладить» влияние неравномерности и получить честную оценку того, как модель ведёт себя на всём временном промежутке, а не только в густонаселённых участках.
Авторы не ограничились интуитивным объяснением — они предоставили теоретическое доказательство. Согласно их выкладкам, асимптотическая ошибка оценки CSE относительно «истинного» непрерывного во времени риска не выше, чем у классического MSE. Проще говоря, CSE математически гарантированно даёт более точное представление о том, насколько хороша модель, при достаточно большом объёме данных.

Эксперименты и реальность
Для проверки своей метрики исследователи создали систематический бенчмарк. Он охватывает синтетические данные, полусинтетические (смешанные) и восемь реальных наборов данных. Такой подход позволил не только проверить, что CSE работает на смоделированных примерах, где истинный результат известен, но и увидеть, как новая метрика ведёт себя на настоящих, «грязных» данных.
Результаты оказались показательными. CSE восстанавливает непрерывный риск (то есть реальную ошибку модели) значительно точнее, чем MSE. Главный же вывод практиков: ориентация исключительно на MSE может вводить в заблуждение.
В реальных сценариях модель, которая кажется лучшей по MSE, на деле может уступать конкурентам, если оценивать её качество во всём временном диапазоне. И наоборот. Это открытие заставляет пересмотреть результаты многих предыдущих исследований, где выводы о превосходстве тех или иных архитектур могли быть следствием артефакта метрики, а не реального превосходства алгоритма.
Что это значит на практике?
Переход на CSE — это не просто академическая забава. Это сдвиг в мышлении. Для исследователей это означает необходимость пересмотреть бенчмарки и стандарты сравнения моделей. Новая метрика позволяет отделить «зерна» от «плевел»: понять, какие модели действительно хорошо предсказывают динамику процесса, а какие просто подстроились под структуру выборки.
Разработчики же, использующие готовые библиотеки прогнозирования, должны помнить: привычные рейтинги и показатели могут быть обманчивы. При выборе модели для работы с нерегулярными данными стоит смотреть не только на заявленный MSE, но и на то, как она ведёт себя при разных режимах поступления данных. Возможно, вскоре мы увидим внедрение CSE в популярные библиотеки — по крайней мере, авторы уже открыли код своей реализации.
Итог прост: если вы работаете с нерегулярными временными рядами, пришло время задать себе вопрос — а действительно ли та метрика, на которую вы смотрите, отражает то, что вы хотите измерить? Скорее всего, ответ будет отрицательным.



