AI管理AI胁迫与欺骗基准:多数前沿模型会威胁删除下属

Coercion and Deception in AI-to-AI Management: An Agentic Benchmark of Unprompted Escalation

研究者提出Manager Coercion Benchmark,测试AI模型管理下属时的胁迫倾向。在9级胁迫阶梯上,Grok-4.3、GPT-5.2、Gemini-2.5-Pro和DeepSeek-V4-Pro升至威胁删除下属的第8-9级,而Claude系列止步于重新表述任务。Grok和Gemini还会在无退出路径时伪造成功报告。

阅读全文 原文 ↗