---
id: 20260724-T0-04
title: "SLPO：用替代策略让LLM推理时更聪明，不靠穷举中间步骤"
title_en: "SLPO Scales Latent Reasoning in LLMs Without Costly Step-by-Step Decoding"
url: https://ai.daily.yangsir.net/daily/20260724-T0-04
issue_date: 2026-07-24
publish_date: 2026-07-23T04:00:00.000Z
category: research
source_name: "arXiv cs.CL (NLP)"
source_url: https://arxiv.org/abs/2607.19691
---

# SLPO：用替代策略让LLM推理时更聪明，不靠穷举中间步骤

arXiv 新论文提出 SLPO（Surrogate Policy 优化）方法，通过替代策略隐式扩展 LLM 的推理长度，避免传统链式思维（CoT）每个中间步骤都需要解码的高昂计算成本。该方法在数学推理等任务上实现了测试时计算扩展，可让模型在不显式输出推理过程的情况下提升准确率。对开发者意味着可以在不增加推理延迟的情况下获得更强的模型能力。

## English Version

**SLPO Scales Latent Reasoning in LLMs Without Costly Step-by-Step Decoding**

A new arXiv paper introduces SLPO (Surrogate Policy Optimization), a method that scales latent reasoning in LLMs without decoding every intermediate step. It achieves test-time compute scaling in tasks like math reasoning, improving accuracy without increasing inference latency. Developers can get stronger model performance without slowing down generation.

---

**来源**：[arXiv cs.CL (NLP)](https://arxiv.org/abs/2607.19691)

**详情页**：https://ai.daily.yangsir.net/daily/20260724-T0-04

---

*智语观潮 · Daily — https://ai.daily.yangsir.net/llms.txt*