对比Claude opus 4.6(来自Anthropic)
gpt-5.3-codex(来自openai)思维链极力回避判断原本流程可能存在的问题,
发给codex一份脚本,让它判断存在的问题它会答非所问,除非明确指出哪里存在哪个设计逻辑问题(比如并不存在的参数),否则它只会继续叠屎山加代码,完全不关心代码是否可以跑起来
明明纸面跑分超过opus4.6,实际表现非常糟糕,vibe coding写出来的代码完全不能使用,作为opus4.6的下级agent表现倒是勉强可用
对比Claude opus 4.6(来自Anthropic)
gpt-5.3-codex(来自openai)思维链极力回避判断原本流程可能存在的问题,
发给codex一份脚本,让它判断存在的问题它会答非所问,除非明确指出哪里存在哪个设计逻辑问题(比如并不存在的参数),否则它只会继续叠屎山加代码,完全不关心代码是否可以跑起来
明明纸面跑分超过opus4.6,实际表现非常糟糕,vibe coding写出来的代码完全不能使用,作为opus4.6的下级agent表现倒是勉强可用