---
id: 20260813-T0-04
title: "大模型“知道”但“说不出”？探测器发现错误却无法预警"
title_en: "Knowing-Saying Gap: Probes Detect Errors But Can't Predict Failures"
url: https://ai.daily.yangsir.net/daily/20260813-T0-04
issue_date: 2026-08-13
publish_date: 2026-08-12T04:00:00.000Z
category: research
source_name: "arXiv cs.AI"
source_url: https://arxiv.org/abs/2608.07528
---

# 大模型“知道”但“说不出”？探测器发现错误却无法预警

arXiv 新研究发现，线性探针能近乎完美地检测大模型中的上下文损坏，但这并未转化为可靠的故障预测。在多跳算术任务中，模型内部状态已“知道”错误，但最终输出却表现正常，形成“知道-说出来鸿沟”。这对部署监控有直接影响：仅靠探针检测不够，需要结合更多信号。该研究为提升大模型可靠性提供了新视角，尤其在安全敏感场景。

## English Version

**Knowing-Saying Gap: Probes Detect Errors But Can't Predict Failures**

A new arXiv study shows linear probes detect corrupted context in language models with near-perfect accuracy, but this doesn't lead to reliable failure prediction. In multi-hop arithmetic tasks, the model's internal state "knows" errors, yet outputs remain normal, creating a knowing-saying gap. This has direct implications for deployment monitoring—probe signals alone are insufficient. The research offers new perspectives for improving LLM reliability in safety-critical scenarios.

---

**来源**：[arXiv cs.AI](https://arxiv.org/abs/2608.07528)

**详情页**：https://ai.daily.yangsir.net/daily/20260813-T0-04

---

*智语观潮 · Daily — https://ai.daily.yangsir.net/llms.txt*