---
id: 20260701-T0-11
title: "ATOD：通过退火感知策略解决长周期智能体训练难题"
title_en: "ATOD: Annealed Turn-aware Distillation for Long-horizon Agent Training"
url: https://ai.daily.yangsir.net/daily/20260701-T0-11
issue_date: 2026-07-01
publish_date: 2026-06-30T04:00:00.000Z
category: research
source_name: "arXiv cs.AI"
source_url: https://arxiv.org/abs/2606.27814
---

# ATOD：通过退火感知策略解决长周期智能体训练难题

针对多轮长周期自主智能体的训练，一项新研究提出了ATOD（Annealed Turn-aware On-policy Distillation）方法。该方法结合了快速模仿和基于奖励的改进，旨在解决传统策略蒸馏在长交互任务中效果衰减的问题。论文指出，ATOD能有效提供密集的教师指导，提升小语言模型在复杂任务中的表现。

## English Version

**ATOD: Annealed Turn-aware Distillation for Long-horizon Agent Training**

A new paper introduces ATOD (Annealed Turn-aware On-policy Distillation) for training multi-turn autonomous agents. Addressing the limitations of on-policy distillation in long-horizon tasks, ATOD combines fast imitation with reward-driven improvement to provide dense teacher guidance and enhance performance.

---

**来源**：[arXiv cs.AI](https://arxiv.org/abs/2606.27814)

**详情页**：https://ai.daily.yangsir.net/daily/20260701-T0-11

---

*智语观潮 · Daily — https://ai.daily.yangsir.net/llms.txt*