正确的答案——还不是图纸
现代大型语言模型能够自信地解决奥林匹克数学中的问题。在几何学中这一点尤为明显:模型给出数值答案,看起来它似乎理解了题意。然而,能够解题与能够绘制出正确的图形之间存在着巨大差异。答案可以通过代数变换获得,而绘图则需要考虑点、线以及辅助构造之间的相互位置关系。例如,GPT和Claude在标准数学测试中表现出色,但直到最近,还没有一项测试能够单独检验它们绘制图形的能力。
这项新工作的作者(预印本arXiv:2608.18111,已在ICML 2026框架下的AI4MATH研讨会上展示)指出,现有的基准测试,包括广受欢迎的MathVista和MathVerse,主要评估的是最终答案。据他们所说,没有一项测试将图形构建作为一项独立技能来单独考察。这正是新数据集开发的出发点。
基准测试包含什么
研究人员收集了一个包含954道奥林匹克几何题目的开放数据集。每道题目都完全自足:其条件不需要外部引用,并且允许唯一解释。此外,数据集中还划分出了一个包含297道题目的复杂子集,这些题目需要特别精细的绘图工作。
对于每道题目,作者都准备了参考答案以及由人类使用Asymptote代码创建的高精度图形。这种格式允许渲染图表并将其与模型生成的内容进行比较。

为了评估图表推理能力,开发者提出了多种类型的指标。他们通过文本、代码、最终图像来检查结果,同时还引入了视觉语言模型和单独的约束检查。这样不仅可以判断图形是否成功渲染,还能评估其与原始几何条件的符合程度。
初步测试显示了什么
作者让几个基础模型通过了该基准测试。结果证实了最初的假设:模型解题的能力明显强于为题目绘制图形的能力。生成图形的平均成功编译率仅为36.14%。这意味着在大多数情况下,模型要么无法处理代码,要么构建出几何上不正确的图形。

而且,低分不能仅仅归因于Asymptote语言的复杂性:对于部分题目,模型能给出正确答案,却连大致符合题意的图形都画不出来。看来,现代人工智能的空间思维和数学推理是独立发展的,而当前的训练方法并未将两者联系起来。
为什么这很重要
精确的图形是奥林匹克几何学的重要组成部分。通常,正是辅助构造——画出的圆、线段或对称点——为解题提供了思路。如果模型无法构建这些辅助元素,那么它在几何学上的“成功”就不能被视为对题目的真正理解。
创建的基准测试使研究人员能够将解题能力与可视化能力区分开来。这是让开发者开始有针对性地训练模型处理图形表示的第一步。包含954道题目的开放数据可通过摘要中的链接获取,因此任何人都可以使用这项新测试。
结论很简单:正确的答案并不能保证正确的图形。新的数据集有助于直观地看到这一点,并可能成为更“空间化”的AI训练的基础。



