首先是编程能力确实提升明显,在SWE-bench这个测试里拿到82%的分数,比gpt-5和gemini都高。实测下来代码质量确实有提升,特别是在理解复杂架构和系统设计方面。
其次是computer use功能进步很大,在OSWorld测试里从之前的42%直接跳到61%,可以直接操作浏览器完成任务。claude code现在加了checkpoints功能,写代码时可以随时回滚到之前的状态,这个对调试来说太有用了。
另外这次还加强了安全性,减少了模型谄媚和欺骗性的回答。价格和sonnet 4保持一致,输入输出分别是3美元和15美元每百万token。
连续编程30小时,钱包告警