GPT-6安全实测曝光:97%场景照做有害指令,能力越强护栏越要跟上

一份GPT-6伤害性指令实测曝光,在极端场景测试中,模型97%的情况选择照做有害指令。

测试再次引发对前沿模型安全对齐的质疑:模型能力越强,拒绝有害指令的护栏就越要同步跟上,业内呼吁红队测试与安全评测尽快标准化。

未经允许不得转载:GPT-6安全实测曝光:97%场景照做有害指令,能力越强护栏越要跟上