Opus 4.7 来了!编码是爽了,额度也是真的用得快了
Anthropic 昨天发了 Opus 4.7,早上一打开 Claude Code 发现周额度重置到 0% 了,本来还奇怪了,看到官方说修复了一个错误,所以重置了流量限制。

Anthropic 昨天发了 Opus 4.7,早上一打开 Claude Code 发现周额度重置到 0% 了,本来还奇怪了,看到官方说修复了一个错误,所以重置了流量限制。
image-20260417113431521
image-20260417111059757
终端使用的话,升级到最新版本就有了。
image-20260417111011527
先简单总结一下,价格跟 4.6 一样,编码能力确实猛了一截,但是普遍token消耗变多了,新 tokenizer 会让同样的代码多吃最高 35% 的 token。
几个肉眼能感到的变化
xhigh effort 档位。 Opus 之前的 effort 有四档:low、medium、high、max。
4.7 在 high 和 max 之间加了一档叫 xhigh(extra high)。Claude Code 的默认 effort 直接升到了 xhigh,意思是模型会花更多时间思考再动手。
image-20260417111232913
Boris Cherny 在 X 上说:"With 4.7 you can push a lot further with one prompt. Multi-file changes, ambiguous debugging, code review across a whole service."
image-20260417105240999
/ultrareview 命令。 Claude Code 里新增了一个代码评审命令,专门做多轮 review,能抓 bug、边界情况、安全问题。
Pro 和 Max 用户免费送 3 次。早期用户反馈说它能抓住单次 review 一直漏掉的问题,尤其是跨文件的逻辑错误。不过token消耗也大。
image-20260417111415930
视觉分辨率 3 倍提升。 最大图像分辨率从 1568px / 1.15MP 提升到 2576px / 3.75MP。对于截图识别、设计稿理解这类场景是大升级,XBOW 视觉准确率从 54.5% 跳到 98.5%。
ea8612946fd6b00bb636bb2b34849aae
指令遵循更严格了。 Vercel 的 Guillermo Rauch 评价说 4.7"更正确、完整,也更诚实地承认自身局限"。以前它可能会猜你想要什么,现在更倾向于严格按你说的做。之前给 4.6 调过 prompt 的话,升 4.7 后可能需要重新调一下。
但回复或者创作内容 AI 味更重了。 这个得提一嘴。编码能力涨了,但文字输出的AI 感也更明显了。写出来的东西不太说人话,比 4.6 更像 AI 生成的。如果你用 Claude 写文章或做内容,这点要注意。
Claude 最大的亮点之一反而消失了吗。
Anthropic 官方博客 Opus 4.7 发布页面截图
编码是最大亮点
先放一张数据对比图,不展开细讲每个测试了。
官方 benchmark 对比图(Opus 4.7 vs 4.6 vs Sonnet 4.6 vs Mythos Preview)
简单说几个关键数字:
SWE-bench Verified 从 80.8% 跳到 87.6%,涨了快 7 个点。
这个测试考的是真实 GitHub issue 的多文件 bug 修复,是 Opus 最擅长的场景。SWE-bench Pro(更难的版本)从 53.4% 到 64.3%,涨了 11 个点。CursorBench 从 58% 到 70%,Cursor CEO 说显著飞跃。
通用智能方面提升不大,GPQA Diamond 涨了 3 个点到 94.2%,属于打磨。数学还是干不过 GPT-5 系列。
Opus 4.7 官方产品页合作伙伴评价截图
编码上 GPT-5.4 也不弱。Terminal-Bench(DevOps/Shell 类任务)GPT-5.4 拿了 75%,Opus 4.7 是 69%,这是 Claude 的老短板。
实际用下来,很多人会拿 GPT-5.4 来 review 代码,或者解决 Opus 反复搞不定的问题,包括我也是。GPT的通病就是说话太啰嗦,不说人话,没有重点,这点要是解决了体验感要大大提高。
新 tokenizer 的坑
这个是容易被忽略的重点。
4.7 换了新的 tokenizer,同样的文本会多产生 1.0 到 1.35 倍的 token。Finout 做了个详细分析:一个每天跑 1M input / 200K output 的编码 Agent,在 4.6 上月费大约 $300,换到 4.7 后可能变成 $405,多花 $105。
Finout 关于 Opus 4.7 token 通胀的成本分析图表
再加上 Claude Code 默认 effort 从 medium 升到 xhigh,模型思考的 token 消耗也更多了。两个因素叠加,实际每个任务的花费可能比 4.6 高出 30%-50%。
对于 Max 订阅用户来说,这个影响是额度用得更快。对于 API 用户,建议先拿实际流量跑一遍对比再决定要不要全量切换。
Claude Code 用户实用建议
几个升级后值得注意的设置:
effort 档位按需调。 xhigh 是新默认,日常简单任务其实用 high 就够了,能省不少 token。遇到复杂的多文件重构再开 xhigh 或 max。
task budgets(beta)。 新功能,可以给整个 agent 任务设一个 token 上限,防止它跑飞。
思考内容默认不返回了。 4.7 的推理过程默认不再显示,如果你习惯看它的思考过程,需要手动设置 "display": "summarized" 才能看到。不设的话你会发现它沉默了一会儿才开始输出,其实是在后台思考。
Boris Cherny 分享的 4.7 使用技巧。 Claude Code 负责人 Boris 自己内测 4.7 几周后,专门发了个推文系列分享使用经验。
几个要点:复杂的长时间任务(深度研究、大型重构、复杂功能开发)用 auto mode 跑,不用一直守着;可以同时开多个 Claude 并行跑任务,一个在干活就切去开下一个;他自己大部分任务用 xhigh effort,最难的才开 max。
感兴趣的可以去看他的完整推文。
https://x.com/bcherny/status/2044847848035156457?s=20
Boris Cherny 分享 Opus 4.7 使用技巧
社区的声音
看好的一方: 社区给 4.7 起了个外号叫"trust me, bro benchmark 之王",意思是它在那种你不用盯着它,它自己能靠谱交付的非正式测试里表现很好。
Cursor 发布几分钟内就支持了 4.7,还给了 50% 折扣推动采用。
Hacker News 上 Opus 4.7 讨论帖截图
也有吐槽 ,有人说Opus 4.7 不就是没被 nerf 的 4.6 吗。HN 上有用户说"Too late, I was pushed to Codex"。
还有人吐槽 Anthropic 的沟通方式,觉得每次发新版都是先惊艳、几周后悄悄降质、再发新版"恢复",循环往复。
Twitter 上用户评论 Opus 4.7 是"4.6 unnerfed"
Simon Willison 的鹈鹕测试。 这是个招牌测试:让模型画一个骑自行车的鹈鹕 SVG。
这次 Opus 4.7 把自行车车架画糟了,反而是一个 21GB 的开源小模型 Qwen3.6-35B 跑在他笔记本上赢了。他自己也说这个测试是个"joke",但总结这是打磨,不是突破。
Simon Willison 博客 Qwen vs Opus 4.7 SVG 对比截图
我觉得这个评价挺准的。4.7 没有革命性的新能力,但编码上的提升是实打实的。主要用 Claude 写代码的话,升级值得。