原文链接: https://every.to/vibe-check/vibe-check-claude-sonnet-4-5
作者: Dan Shipper
发布日期: 2025年9月29日
Anthropic 最近推出了全新的 Claude Sonnet 4.5。毫无意外地,我们花了整个周末让它写代码、跑长任务,尽情测试了一番。
结论先放在这里
Sonnet 4.5 的速度明显更快,可控性更强,也更可靠。特别是在 Claude Code 环境中,比起之前的 Opus 4.1 更是提升了一大截。
在直接对比测试中,它能迅速审查一个大型的代码提交,精确把控多个文件之间的逻辑关系,而且当我们要求它保持精简时,它也从不废话。
当然,在攻克最棘手的线上生产代码问题时,它还没能超越 GPT-5 Codex。不过,对于日常开发工作而言,Sonnet 4.5 已经是一个令人兴奋的进步。以下是我们第一天的「Vibe 检测」。
速度
如果你曾经在 Claude Code 或 Claude 应用里使用过 Opus,你一定会对 Sonnet 4.5 的速度感到惊喜。
智能邮件应用 Cora 的总经理 Kieran Klaassen 说:
“用起来比之前的 Claude 快了至少 50%。”
在一场直接对比的代码审查竞赛中:
- Sonnet 4.5:两分钟就审完了一个复杂功能的代码提交
- GPT-5 Codex:完成同样任务花了约 10 分钟
速度本身也是一种智能的体现,这种快速反馈,让 Sonnet 4.5 非常适合结对编程。
性能表现
Sonnet 4.5 在长时间、复杂的 Agentic Tasks 中表现非常出色。
- 我把我们公司 Every 的三个重要表格(利润表、每周运营数据表、咨询追踪表)交给它处理。它轻松生成了第三季度的投资者更新文件,几乎无需修改即可直接发送。
- Kieran 用它解决了 Cora 应用中的一个 bug,仅花了约 20 分钟,而 Opus 4.1 完全搞不定。
- 他甚至玩起了「凭感觉编程 (Vibe Coding)」——把 Cora iOS 代码和 iOS 教程丢进去,很快就得到了一个不错的应用:
📷 Kieran 用 Claude Sonnet 4.5「凭感觉」编写出的 Cora iOS 应用
主要提升点
-
更强的可控性(Steerability)
- 更准确理解并执行提示,不再「自作主张」。
- 提升了稳定性和可靠性。
-
处理超长上下文能力更强
- 面对大型代码库或长提示时不会迷路,更懂得抓重点。
-
更确定、更稳定
- 同一提示多次运行,结果一致性更高,预测性更强。
-
表达更聚焦、更精练
- 学习了 GPT-5 的风格,更直截了当,少废话。
仍存在的弱点
- GPT-5 Codex 在复杂生产环境任务中依旧更强。
- 在一次大型代码审查测试中,Codex 找到了一个隐蔽的 edge case bug,而 Sonnet 没能发现。
日常使用的「触手可及」测试
判断一款 AI 工具长期是否真正有用,最直观的标准就是:
遇到问题时,我们会第一时间想到用它吗?
-
Dan 的答案:不太会
- 目前首选依旧是 ChatGPT 和 Codex CLI,因为可靠性更高。
- 如果一定要用 Claude 系列,那肯定选 Sonnet 4.5,而不是 Opus 4.1。
-
Kieran 的答案:肯定会
- 更喜欢 Sonnet 4.5 + Claude Code 的组合。
- 他的比喻:
- Claude Code = 拥有 20 年经验的程序员
- Opus 4.1 = 拥有博士学位的专家
- GPT-5 Codex = 脾气暴躁的资深工程师
-
Alex 的答案:也会
- 倾向用 Sonnet 4.5 取代 Opus 4.1。
- 目前 Claude Code 依旧是他超过 Codex CLI 的首选工具。
最终结论
如果你已经用 Claude Code 作为主力编程工具,Sonnet 4.5 会让你非常开心:
- 更快
- 更稳定
- 更容易精准控制
如果你是 GPT-5 Codex 的忠实用户,它未必能让你转投。但在这些场景下值得一试:
- 启动新项目
- 玩「凭感觉编程」
- 需要 Claude 系列特有的「勤劳速度型」任务
定价:
- Sonnet 4.5 定价未公布
- 如果延续 Sonnet 4.0:每百万输入 token 仅 3 美元
- 对比:Opus 系列 15 美元/百万 token
- GPT-5 Codex 依旧更便宜
作者信息
Dan Shipper
- Every 联合创始人 & CEO
- 主持播客《AI & I》
- 定期撰写 Chain of Thought 专栏