不规则时间序列:为什么MSE已经过时了?
预测不规则时间序列是一项随处可见的任务:从金融交易到医疗传感器数据。在这类序列中,观测值并非以固定间隔到达,而是杂乱无章地出现,带有缺失和密集聚集。乍一看,这里的主要问题似乎是构建一个能够应对数据不均匀性的智能模型。然而,正如arXiv研究人员的最新工作(预印本2608.17293)所显示的那样,存在一个更根本的问题:我们只是错误地评估了这些模型的质量。
看不见的测量误差
多年来,评估预测质量的事实上标准一直是均方误差(MSE)。逻辑很简单:预测与真实值之间的差异越小越好。但当我们谈论不规则时间序列时,这种逻辑就崩塌了。
魔鬼藏在细节中:MSE只在数据中存在实际观测值的时间点测量误差。在不规则序列中,这些时间点分布极其不均匀。结果就是,最终指标很大程度上不取决于模型对过程的理解有多好,而取决于具体样本中测量点是如何分布的。
想象两位医生测量患者的血压。一位每15分钟测量一次,另一位每天测量几次。而血压本身在持续变化。如果我们仅通过与测量点进行比较来评估预测精度,结果会仅仅因为测量频率不同而产生巨大差异,而不是因为预测的真实质量。论文作者称之为有偏估计——模型可能在一个数据集上表现出色,在另一个数据集上却表现糟糕,仅仅因为其中的时间戳分布不同。

正因如此,MSE在此语境下衡量的与其说是算法的“预测能力”,不如说是测试样本中时间戳的具体配置。
CSE:尝试超越时间戳
研究中提出的解决方案称为连续时间平方误差(CSE)。该指标的思想很优雅:CSE不是仅在离散的观测点上比较预测与真实值,而是试图在连续时间上评估模型的误差。
它是如何工作的?关键机制是重要性加权(importance weighting)。每个观测点获得一个权重,与其附近时间戳采样的密度成反比。如果某个时间段内测量非常密集,那么每个具体测量对整体评估的贡献就较小。如果测量稀疏,它们的权重就会增加。这样可以“平滑”不均匀性的影响,从而对模型在整个时间区间上的表现给出公正的评估,而不仅仅是在密集区域。
作者并未止步于直觉解释——他们提供了理论证明。根据他们的推导,CSE相对于“真实”连续时间风险的渐近估计误差不高于经典MSE。简而言之,在数据量足够大的情况下,CSE在数学上保证了能更准确地反映模型的好坏。

实验与现实
为了验证他们的指标,研究人员构建了一个系统性的基准测试。它涵盖了合成数据、半合成(混合)数据以及八个真实数据集。这种方法不仅验证了CSE在已知真实结果的模拟示例上有效,还能观察新指标在真实、杂乱的数据上的表现。
结果很有说服力。CSE恢复连续风险(即模型的真实误差)的准确度远高于MSE。而实践者的主要结论是:仅依赖MSE可能会产生误导。
在真实场景中,根据MSE看似最好的模型,如果从整个时间范围来评估其质量,实际上可能不如竞争对手。反之亦然。这一发现促使人们重新审视许多先前的研究结果,其中关于某些架构优越性的结论可能只是指标伪影的结果,而非算法的真正优势。
这在实践中意味着什么?
转向CSE不仅仅是一种学术消遣。这是一种思维方式的转变。对于研究人员来说,这意味着需要重新审视基准测试和模型比较的标准。新指标能够区分“良莠”:识别哪些模型真正很好地预测了过程的动态,哪些只是适应了样本的结构。
而对于使用现成预测库的开发者来说,应该记住:惯常的排名和指标可能具有欺骗性。在选择处理不规则数据的模型时,不仅要看声明的MSE,还要看它在不同数据到达模式下的表现。也许不久我们就会看到CSE被引入主流库中——至少作者已经公开了他们实现的代码。
结论很简单:如果你在处理不规则时间序列,是时候问自己一个问题——你正在看的那个指标,真的反映了你想衡量的东西吗?很可能,答案是否定的。



