---
id: 20260625-T0-05
title: "SGPO：通过策略引导优化提升LLM推理能力"
title_en: "SGPO: Strategy-Guided Policy Optimization for LLM Reasoning"
url: https://ai.daily.yangsir.net/daily/20260625-T0-05
issue_date: 2026-06-25
publish_date: 2026-06-24T04:00:00.000Z
category: research
source_name: "arXiv cs.AI"
source_url: https://arxiv.org/abs/2606.24064
---

# SGPO：通过策略引导优化提升LLM推理能力

新论文提出策略引导策略优化（SGPO）方法，解决强模型向弱模型蒸馏时只模仿结果而不模仿过程的问题。该方法鼓励模型学习“如何推理”而非死记硬背答案轨迹，显著提升了LLM的泛化推理能力。

## English Version

**SGPO: Strategy-Guided Policy Optimization for LLM Reasoning**

A new paper proposes Strategy-Guided Policy Optimization (SGPO) to address the limitation of distilling reasoning capabilities where models imitate answers rather than the process. SGPO encourages learning 'how to reason' over memorizing solution trajectories, significantly improving the generalizable reasoning capabilities of LLMs.

---

**来源**：[arXiv cs.AI](https://arxiv.org/abs/2606.24064)

**详情页**：https://ai.daily.yangsir.net/daily/20260625-T0-05

---

*智语观潮 · Daily — https://ai.daily.yangsir.net/llms.txt*