DeepFloodbeta

Claude Sonnet 4.5刚发布,聊聊这次更新的几个亮点

Anthropic在9月29日发布了Claude Sonnet 4.5,这次更新还挺有意思的,价格没涨但能力提升不小。

1.编程这块确实强了,在SWE-bench Verified评测中拿到77.2%的成绩,号称是"世界最佳编程模型"。实际用下来,处理大型项目的时候明显比之前稳定,不会动不动就断思路了。以前用Sonnet 4处理复杂任务顶多7小时就开始不靠谱,现在4.5能持续工作30小时以上,这个对做agent开发的人来说还挺实用。

2.计算机操作能力也有提升,在OSWorld基准测试里得分61.4%,比Opus 4.1高出17个百分点。最近有个Chrome扩展可以直接让Claude操作浏览器,填表单、浏览网页这些都能自己搞定,虽然还在早期阶段但确实能看到一些agent的雏形。

除了性能提升,Anthropic这次还特别强调了对齐和安全性。他们说新模型在"逢迎"、"欺骗"这类不良行为上有明显改善,提示注入攻击的防御也增强了。对开发者来说这个还挺重要的,尤其是要把模型接入生产环境的时候。

3.另外发布了个叫"Imagine with Claude"的实验功能,可以实时生成软件,不过只对Max订阅用户开放5天。看演示挺酷的,但实际场景能用到多少还得观察。

4.工具这块也更新了不少。Claude Code加了检查点功能可以回滚,还有原生VS Code扩展。API里新增了上下文编辑和记忆工具,让agent能跑得更久。应用内直接支持代码执行和文件创建,对日常使用来说方便了不少。

5.定价还是跟Sonnet 4一样,输入3美元/百万tokens,输出15美元/百万tokens。如果用提示缓存能省90%,批处理能省50%,对经常调用的场景还是挺划算的。

总的来说这次更新挺实在的,没有虚头八脑的宣传,就是实打实提升了能力。如果你现在用的Sonnet 4,基本可以无缝切换到4.5,体验会好不少。不过也有人反馈早期版本偶尔会有输出不稳定的情况,如果遇到可以先切回Sonnet 4,等几天估计就修好了。

——摘自某个X上的AI大佬