GPT-5.5 来了!价格翻倍但能力翻了不止一倍,OpenAI 逆风翻盘
OpenAI 推出了 GPT-5.5。先说结论,我觉得开发上Claude的位置要动摇了。GPT-5.5 能理解复杂目标、使用工具、检查自己的工作,并把更多任务执行到完成。

OpenAI 推出了 GPT-5.5。先说结论,我觉得开发上Claude的位置要动摇了。GPT-5.5 能理解复杂目标、使用工具、检查自己的工作,并把更多任务执行到完成。
从对话到执行
之前的 GPT 模型主要是回答问题,给建议。GPT-5.5 的核心改进是它能真正完成任务。
OpenAI 在官方博客中举了个例子:他们的传播团队用 GPT-5.5 分析了六个月的演讲邀请数据,建立了一套评分和风险评估框架,还验证了一个自动化的 Slack 机器人。
低风险的请求可以自动处理,高风险的请求仍然会转给人工审核。这不是简单的数据分析,而是从理解需求到设计方案再到验证实施的完整流程。
在 Codex(OpenAI 的智能编程平台)中,GPT-5.5 的表现更明显。有测试者给它一个写得很乱的代码库,让它"整理成一个好的代码库",GPT-5.5 能理解这个模糊的要求,自己判断什么是"好",然后重构代码。
OpenAI Codex 界面
性能提升在哪里
从基准测试来看,GPT-5.5 在 10 个可对比的基准测试中有 9 个都超过了 GPT-5.4,最大的提升出现在 ARC-AGI-2(抽象推理)、MCP Atlas(多工具协作)和 Terminal-Bench 2.0(终端操作)这三个测试上。
这些测试项目不需要推理、规划和工具使用的复杂任务。GPT-5.5 在这些方面的提升,说明它确实更适合处理真实工作场景。
价格方面,GPT-5.5 的每 token 价格翻倍了,但延迟没有增加。
OpenAI 声称在同等智能水平下,GPT-5.5 的成本是竞争对手前沿编程模型的一半。
用户怎么说
有人觉得 GPT-5.5 "强得可怕",特别是在 Cursor 的 Agent 模式中使用时,完成任务的能力明显提升。也有人觉得发布会出错又无聊,但实际测试后改观了。
一个比较一致的反馈是:GPT-5.5 减少了过度附和的行为。在专门设计的谄媚测试中,谄媚回复率从 14.5% 降到了不足 6%。它用的表情符号更少,回应更细腻和深思熟虑。
之前的模型有时候会过度迎合用户,给出不够准确的答案,现在这个问题有所改善。
在知乎的讨论中,有用户指出 GPT-5.5 背后其实不是单一模型,而是有一个路由器根据用户意图(对话类型、问题复杂度、是否需要工具)来判断调用哪个模型。
简单任务用响应快的模型,复杂任务用能力强但耗时久的 thinking 模型。这个路由器还在根据用户反馈持续优化。
用户不需要手动选择用哪个模型,系统自动判断,既保证了响应速度,又不牺牲复杂任务的处理能力。
OpenAI GPT-5.5 官方发布页
智能体时代的开始
GPT-5.5 的发布,标志着 OpenAI 从对话式 AI向智能体 AI的转变。
之前的 AI 主要是回答问题、生成内容,用户需要把任务拆解成一个个具体的指令。现在的 AI 能理解高层次的目标,自己规划步骤,使用工具,检查结果,把任务执行到完成。
这个转变意味着你可以把更复杂的任务交给 AI。
当然,这也带来了新的挑战。智能体需要更多的权限和工具访问,如何保证安全性?如何避免 AI 做出错误的决策?如何让用户保持对任务的控制?这些问题还没有完美的答案。
但方向是明确的。AI 不再只是一个聊天机器人,而是一个能独立完成工作的智能体。
最后
codex 升级就可以使用 5.5 模型了,现在可以选择速度,之前说codex 慢的槽点也在解决,体验感好了不是一星半点。
image-20260424103816700
参考资料: