---
id: 20260621-T0-04
title: "LLM后训练数据策略：如何选择最佳对比对（Pair）？"
title_en: "Which Pairs to Compare for LLM Post-Training?"
url: https://ai.daily.yangsir.net/daily/20260621-T0-04
issue_date: 2026-06-21
publish_date: 2026-06-20T04:00:00.000Z
category: research
source_name: "arXiv cs.AI"
source_url: https://arxiv.org/abs/2606.19607
---

# LLM后训练数据策略：如何选择最佳对比对（Pair）？

arXiv新论文研究了基于偏好（Preference-based）的后训练数据收集策略。论文探讨了如何为每个提示词生成最佳完成选项并进行配对，以优化人类偏好对齐。

## English Version

**Which Pairs to Compare for LLM Post-Training?**

A new arXiv paper analyzes data-collection strategies for preference-based post-training. It investigates how to select the best completion pairs for prompts to optimize alignment.

---

**来源**：[arXiv cs.AI](https://arxiv.org/abs/2606.19607)

**详情页**：https://ai.daily.yangsir.net/daily/20260621-T0-04

---

*智语观潮 · Daily — https://ai.daily.yangsir.net/llms.txt*