---
id: 20260825-T0-02
title: "自我推测加速推理模型，减少延迟"
title_en: "Self-speculation speeds up reasoning models, reduces latency"
url: https://ai.daily.yangsir.net/daily/20260825-T0-02
issue_date: 2026-08-25
publish_date: 2026-08-24T04:00:00.000Z
category: research
source_name: "arXiv cs.CL (NLP)"
source_url: https://arxiv.org/abs/2608.20359
---

# 自我推测加速推理模型，减少延迟

arXiv 论文提出一种自我推测方法：通过让模型预测自己的推理轨迹来加速推理，无需外部草稿模型，尤其适合延迟敏感场景。

## English Version

**Self-speculation speeds up reasoning models, reduces latency**

An arXiv paper proposes self-speculation, where LLMs predict their own reasoning traces to speed up inference without external draft models, ideal for latency-sensitive applications.

---

**来源**：[arXiv cs.CL (NLP)](https://arxiv.org/abs/2608.20359)

**详情页**：https://ai.daily.yangsir.net/daily/20260825-T0-02

---

*智语观潮 · Daily — https://ai.daily.yangsir.net/llms.txt*