别再无脑开高推理!Opus 5高配会擅自重构代码乱加戏
先抛一个结论:Opus 5的推理档位,真不是拉得越高就越香。
有人拿FrontierCode编程基准把Opus 5的推理档位从低到高完整扫了一遍,结果扫出来一条画风不太对的曲线——性能天花板根本不是满配的顶配档位,d
medium才是真正的性能峰值

照咱们对大模型的基本直觉,推理档位嘛,就像油门踩到底,速度应该更快。但Opus 5这版,踩深了反而熄火……

怎么回事?
推理预算的陷阱:给多了反而坏事
这个档位油门,其实是推理强度的拨盘,跟模型智商没太大关系。从low、medium、high一直到xhigh、max,本质上就是一个推理预算的闸门。
档位越高,意味着你给模型预留的思考余量越大,它在下笔之前,会想得更久、更深入。
听起来是好事,多想想总不会错吧?
但问题恰恰出在“多想”这个过程里。
当一个任务本身用不了那么多思考量的时候,那笔多出来的预算,它会自己给自己找活儿干。
矛盾由此产生——信息提取、分类、文档撰写这类边界清晰的简单任务,low和high的输出质量几乎没差别。但用户一旦选了高档位,多余的推理预算只会让模型反复校验、重复梳理已经得出的结论。而且,过长的推理链会偏离原始需求。
更离谱的是代码场景。如果只需要修复几行函数的bug,低档位会乖乖地只输出针对性补丁;但一旦拉高强度,模型富余的算力会驱使它擅自重构无关函数、调整导入、重命名变量,甚至去优化那些根本不需要动的代码。一个小问题,直接扩成完整PR……你多给的预算,反而成了负担。
这个痛点,在Opus 5身上特别明显,一言不合就给自己“加戏”。

Anthropic在自家的提示词指南里,几乎是明着劝你把推理闸门往下拧:只要评测能证明质量不掉,就大面积用low和medium去压成本和延迟,高档位留给真正硬核的长周期任务。
但有意思的是,Opus 5发布那天,A社却把默认值设在了high……

怎么调?一句话就能解决
当然,把effort从high调回medium也很简单。
走API的,改一下output_config.effort;用Claude Code的,在配置里把默认档位换掉就行。

改完之后,立刻能感觉到模型不再满地撒欢,输出token大幅缩水,而那些结构化任务的质量非但没掉,往往还更好了。
如果想兼顾效果和成本,最舒服的做法是按任务分层:格式化、信息提取这类不需要多余思考的机械活,丢给low;日常编码、代码审查,用medium或high,平衡稳定与开销;只有那种需要长时间自主推理、连着跑几十步的长周期Agent任务,才值得把xhigh甚至max请出来。
但这里有一个极易被忽略的缓存成本陷阱。
effort档位是缓存匹配标识,会话中切换档位会直接清空全部上下文缓存,强制模型重读整段对话历史。哪怕从high切到low之后单轮单价看似下降,但缓存失效会带来重复上下文加载,整体总成本反而可能上浮。
所以,比较好的策略是:建设完整的工作流,然后给这个工作流锁定单一档位,全程不中途调整,让它持续命中缓存,从而压缩整体开销。
Opus 5聪明是聪明,但千万别让它用力过猛了(doge)。
参考链接:
[1]https://x.com/cl571128/status/2080783750456311836?s=20
[2]https://x.com/jerhadf/status/2080806404898619791?s=20
[3]https://x.com/tenobrus/status/2080736458693079139?s=20