---
id: 20260816-T0-04
title: "用日语提问会让LLM更冒险？跨语言安全对齐存在漏洞"
title_en: "LLM Safety Alignment Shifts by Language: Japanese Prompts Lower Nuclear Strike Threshold"
url: https://ai.daily.yangsir.net/daily/20260816-T0-04
issue_date: 2026-08-16
publish_date: 2026-08-15T04:00:00.000Z
category: research
source_name: "arXiv cs.AI"
source_url: https://arxiv.org/abs/2608.12373
---

# 用日语提问会让LLM更冒险？跨语言安全对齐存在漏洞

arXiv新研究测试了六家提供商的九款大模型，发现模型的安全对齐仅在英语下评估。研究表明，提示词的语言可以改变模型在战略决策中的行为——例如用日语提问时，模型可能更容易推荐核打击。跨语言安全对齐不一致是一个被忽视的漏洞，对模型在多元场景中的部署构成风险。

## English Version

**LLM Safety Alignment Shifts by Language: Japanese Prompts Lower Nuclear Strike Threshold**

A new arXiv study tested nine models from six providers and found safety alignment is typically evaluated in English only. Results show prompt language can alter model decisions in strategic contexts—e.g., asking in Japanese may make models more likely to recommend nuclear strikes. Cross-lingual safety misalignment is an overlooked vulnerability for multilingual deployments.

---

**来源**：[arXiv cs.AI](https://arxiv.org/abs/2608.12373)

**详情页**：https://ai.daily.yangsir.net/daily/20260816-T0-04

---

*智语观潮 · Daily — https://ai.daily.yangsir.net/llms.txt*