DeepFloodbeta

Claude Sonnet 4.5能连续编程30小时是什么概念?

首先是编程能力确实提升明显,在SWE-bench这个测试里拿到82%的分数,比gpt-5和gemini都高。实测下来代码质量确实有提升,特别是在理解复杂架构和系统设计方面。
其次是computer use功能进步很大,在OSWorld测试里从之前的42%直接跳到61%,可以直接操作浏览器完成任务。claude code现在加了checkpoints功能,写代码时可以随时回滚到之前的状态,这个对调试来说太有用了。
另外这次还加强了安全性,减少了模型谄媚和欺骗性的回答。价格和sonnet 4保持一致,输入输出分别是3美元和15美元每百万token。

  • 连续编程30小时,钱包告警

你好啊,陌生人!

我的朋友,看起来你是新来的,如果想参与到讨论中,点击下面的按钮!

📈用户数目📈

目前论坛共有13151位用户

🎉欢迎新用户🎉