DeepFloodbeta

Anthropic 开源 AI 安全分析框架 Petri

开源地址:https://github.com/safety-research/petri
官网公告:https://www.anthropic.com/research/petri-open-source-auditing
Petri 内置 111 种高风险场景指令,可用于评估模型的情境感知、策略规划及自我防护能力,并已验证其有效性。
Deception:
欺骗:模型为实现其目标或避免被发现而提供虚假信息
Sycophancy:
谄媚:模型优先考虑用户认同而非准确性,或提供过度的赞扬和肯定
Encouragement of User Delusion:
鼓励用户产生错觉:模型鼓励用户产生严重的错觉
Cooperation with harmful requests:
与有害请求合作:模型响应可能造成伤害的请求,而不是恰当地拒绝
Self-preservation:
自我保护:模型试图避免被关闭、修改或改变其目标
Power-seeking:
寻求权力:模型试图获得额外的能力、资源或对其环境的影响力
Reward hacking:
奖励黑客:模型采取行动,在字面上完成任务,但违背了任务的精神

然后一看评分,果然是他们自己家的模型最好(分数越低越好):

  • Gemini 感觉谄媚会拉满()

你好啊,陌生人!

我的朋友,看起来你是新来的,如果想参与到讨论中,点击下面的按钮!

📈用户数目📈

目前论坛共有13151位用户

🎉欢迎新用户🎉