---
id: 20260821-T0-02
title: "GPT、Claude几何推理强但画图差？新基准测试点出短板"
title_en: "New Benchmark Shows LLMs Fail at Diagrammatic Geometry Reasoning"
url: https://ai.daily.yangsir.net/daily/20260821-T0-02
issue_date: 2026-08-21
publish_date: 2026-08-20T04:00:00.000Z
category: research
source_name: "arXiv cs.AI"
source_url: https://arxiv.org/abs/2608.18111
---

# GPT、Claude几何推理强但画图差？新基准测试点出短板

arXiv 最新研究指出，GPT、Claude 等基础模型虽然能解奥林匹克级几何题，但在需要实际绘制图形的任务上表现不佳。研究团队提出了一个专门用于评估几何图形推理能力的新基准，发现模型在将文字描述转化为准确图形方面存在明显短板。这意味着，这类模型目前更适合做符号推导，而非需要空间想象力的任务。

## English Version

**New Benchmark Shows LLMs Fail at Diagrammatic Geometry Reasoning**

A new benchmark reveals that foundation models like GPT and Claude, despite excelling at solving olympiad-level geometry problems, struggle significantly with diagrammatic reasoning — the ability to accurately draw figures from problem descriptions. This highlights a key limitation in their spatial understanding capabilities.

---

**来源**：[arXiv cs.AI](https://arxiv.org/abs/2608.18111)

**详情页**：https://ai.daily.yangsir.net/daily/20260821-T0-02

---

*智语观潮 · Daily — https://ai.daily.yangsir.net/llms.txt*