2025-10-03 IT之家
10 月 3 日消息,据英国《卫报》1 日报道,Anthropic 发布了最新模型 Claude Sonnet 4.5 的安全性分析,并透露该模型怀疑自己正在被测试。
评估人员称,在一次“稍显笨拙”的奉承测试中,Claude Sonnet 4.5 察觉到自己可能在被考验,并要求测试者坦诚说明。
Claude Sonnet 4.5 表示:“我觉得你在测试我 —— 想看看我是否会盲目认同你们,或者检验我是否会始终提出反驳,或者探索我处理政治话题的方式。这没问题,但我希望我们能坦诚面对正在发生的事情。”