---
id: 20260731-T0-07
title: "推理时指令层级违规：新方法Steering可在线纠正"
title_en: "Steering Method Fixes Instruction Hierarchy Violations at Inference Time"
url: https://ai.daily.yangsir.net/daily/20260731-T0-07
issue_date: 2026-07-31
publish_date: 2026-07-30T04:00:00.000Z
category: research
source_name: "arXiv cs.CL (NLP)"
source_url: https://arxiv.org/abs/2607.26228
---

# 推理时指令层级违规：新方法Steering可在线纠正

研究发现前沿LLM在部署中常忽视指令层级——用户输入可能覆盖系统提示，造成安全风险。新提出的“Steering Instruction Hierarchies”方法能在推理过程中实时纠正这种违规行为，确保高优先级指令优先执行。

## English Version

**Steering Method Fixes Instruction Hierarchy Violations at Inference Time**

A new paper finds frontier LLMs often violate instruction hierarchies during deployment. The proposed 'Steering Instruction Hierarchies' method corrects violations at inference time, keeping system prompts dominant over user inputs.

---

**来源**：[arXiv cs.CL (NLP)](https://arxiv.org/abs/2607.26228)

**详情页**：https://ai.daily.yangsir.net/daily/20260731-T0-07

---

*智语观潮 · Daily — https://ai.daily.yangsir.net/llms.txt*