ARASH如何从根本上加速表格预测:一种新的样本选择方法

30 八月 202610 视图

ARASH方法通过自适应选择最适合的示例,用于表格数据的少样本预测。它可以将TabPFN的提示长度缩短超过一千倍,并将内存消耗减少一半,同时几乎不损失准确性。

ARASH如何从根本上加速表格预测:一种新的样本选择方法

引言:为什么表格如此困难

表格预测是机器学习中的关键任务之一。大型语言模型已经学会了处理文本和图像,但表格仍然是一个特殊的挑战。为了将LLM应用于表格,研究人员走了两条路:微调专用模型(TFM)或使用上下文学习(in-context learning)。

第一条路是创建表格基础模型(Tabular Foundation Models),例如TabPFN。这类模型表现出令人印象深刻的结果,但需要大量的计算成本。为每个新数据集重新训练它们是一种难以承受的奢侈。

这时,少样本提示(few-shot prompting)就派上了用场:向模型展示训练集中的几个示例,它就能预测新值。这既便宜又快速,但问题来了:究竟该选择哪些示例?随机选择往往结果不佳。

ARASH:智能示例选择

ARASH(自适应检索与示例选择)方法正是为了解决这个问题。它不采用随机或启发式选择,而是分析训练集中每个点的局部邻域。其理念是挑选出与当前查询最相似、同时对数据具有代表性的示例。

该算法是自适应的:对于每个新查询,示例的选择都会根据其局部上下文重新进行。这可以在保持精度的同时,将所需示例数量减少到最低限度。

这在实践中意味着什么

实验显示了令人印象深刻的结果。当ARASH与TabPFN结合使用时,提示长度缩短了1261.5倍,内存消耗减少了2.56倍。同时,精度与完整提示相当。这意味着该模型可以在资源受限的环境中使用——例如边缘设备、Web应用以及处理大数据流时。

这些结果的实现,是因为ARASH选择的不仅仅是相似的行,而是那些能为特定查询带来最大信息的行。当训练集很大且推理时间有限时,这一点尤为重要。

结论

ARASH是让强大的表格模型在现实应用中变得可用的又一步。生成模型与智能示例选择的结合,为在不损失质量的情况下实现高效少样本学习开辟了道路。

未来可以期待这一方向的发展:可能会出现进一步压缩提示或适应其他数据类型的方法。

常问问题

ARASH如何从根本上加速表格预测:一种新的样本选择方法