文|AIX财经 雷晶
编辑|金玙璠
7月的模型圈很热闹。
25日凌晨,Anthropic正式推出了新模型Claude Opus 5。
这一次,Anthropic没有强调“最强模型”,而是给出更务实的定位:Opus 5在复杂任务上更少遗漏步骤、更倾向主动验证中间结果,在多项评测中兼顾性能与成本,适合日常高频使用。
定位的变化也直接体现在产品里,目前Opus 5成为Claude Max的默认模型,也是面向个人订阅用户(Max/Pro)可调用的最强模型;能力更高的Fable 5主要面向API与企业客户,个人订阅用户虽然可用,但额度相当有限。
从官方公布的成绩来看,Opus 5重点提升了编程、知识工作和智能体任务的完成效率,在多项软件工程、商业流程和电脑操作评测中位居前列;在最高思考档位下,部分成绩已经逼近甚至超过Fable 5。不过,在进攻性网络利用和长周期自主生物研究等高风险场景中,受限的Mythos 5仍然更强。
Opus 5提供了可调节的effort(思考档位),用户可按任务难度调整推理资源投入。档位越高,处理复杂问题的能力越强,但速度更慢、Token消耗也更多;调低则省时省钱。
目前,Opus 5已在全平台上线,API价格为每百万Token输入5美元、输出25美元,与Opus 4.8持平,约为Fable 5的一半;追求速度可开Fast模式,以约两倍价格换2.5倍速度。
Anthropic同时上线了两项Beta功能:动态调整工具与自动回退,用于降低Agent任务因缓存失效抬升成本、或因安全拦截中断的风险。
性能逼近、价格减半,那Opus 5能替代Fable 5吗?
01.登上榜首,但不是断层领先
我们先来看官方给出的成绩单。
为了突出模型的领先性,Opus 5的对比对象选的是当前能力最强的几款模型:上一代Opus 4.8、公开旗舰Fable 5,以及OpenAI刚发布的旗舰模型GPT-5.6 Sol。

软件工程是最突出的方面。在Frontier-Bench v0.1测试中,Opus 5超过所有参测模型,成绩相比Opus 4.8提高一倍以上,单项任务成本反而更低。在CursorBench 3.2测试中,开启max effort后,两者成绩相差不到0.5%,每项任务成本约为后者一半。
类似优势也出现在需要模型连续操作的任务中。在Zapier AutomationBench测试中,按相同的单项任务成本计算,Opus 5通过率约为第二名(Fable 5)的1.5倍。在OSWorld 2.0测试中,它仅用Fable 5单项任务成本的略多于三分之一,超过了后者最好成绩。
这些项目的共同点在于,测试的不只是模型能否答对一道题,还包括它能否调用工具、跨越多个步骤、发现错误并继续推进。

ARC-AGI 3主要考察模型处理陌生规则和新问题的能力。Opus 5得到30.2%,此前榜首是GPT-5.6 Sol的7.8%。不过该成绩取自high档而非max档,max档结果尚未公布。至少在此设定下,Opus 5展现了较强的规则归纳、观察与试错能力。
不过,Opus 5并非在所有项目中都领先。在Anthropic公布的十余项对比中,有四项落后其他模型。
在Humanity’s Last Exam测试中,不用工具时,Opus 5得56.3%,略低于Fable 5的56.5%;开放工具后Opus 5升至64.7%,反超Fable 5的63.9%。这更能说明两者差别:Fable 5仍有更强的纯模型能力,Opus 5更擅长搜索、调用工具、检查结果并持续推进任务。
Anthropic披露的案例也符合这一特点。Opus 5在没有图像查看工具的情况下,自行编写计算机视觉程序,从机械图纸的原始像素中提取数据;在缺少实时行情的情况下,主动搭建测试环境验证交易所数据接口是否正确。
从这些表现来看,Opus 5此次升级的重点,与其说是纯模型能力的跃升,不如说是执行、验证和纠错能力变得更成熟。
当然,官方跑分需要谨慎看待。以Frontier-Bench测试为例,结果是在特定智能体框架下进行五次测试后取平均值,触发安全分类器时还会由Opus 4.8接管,说明工具配置、提示词和运行环境发生变化,结果也可能变化。
我们再来看看第三方榜单。
截至7月25日,Artificial Analysis的智能指数榜单上,Opus 5 max以61分排在第一位,仅高于第二名的Fable 5一分。该榜单综合9项评测,比单看某个优势项目更能反映综合能力。

到这里可以得出两个结论。第一,Opus 5进入当前第一梯队,而且在最高思考档位下暂时排在榜首。第二,在各项测试中,Opus 5并没有和其他模型拉开明显差距,没有形成断层优势。
所以,Opus 5只是当前榜单上的领先者。跑分给出了能力上限,真实使用中的稳定性、Token消耗和最终交付质量,才决定性价比究竟高不高。
02.跑分更高,不等于活干得更好
模型上线后,评价很快两极分化。
正面评价集中在编程和可交互内容生成。有网友在X上分享Opus 5生成的可交互3D黑洞可视化器,还能实时合成一段电子音乐,代码、视觉效果和声音被整合进同一个成品,说明它快速制作产品原型的能力很强。

也有网友将Opus 5和Fable 5、GPT-5.6、Kimi K3对比,认为它在3D的制作上效果更好。

但也有开发者认为,Opus 5在部分任务中过度思考,推理过程很长,做到后面甚至会“我行我素”,偏离最初目标。有网友测试后称,模型消耗了大量Token,并占用了较多上下文空间,却没有严格按照要求执行,更高的effort并不一定带来更好的结果。

更系统的测试来自代码审查平台CodeRabbit。它的结论是,Opus 5更适合写代码,而不是独立承担全部代码审查工作。它处理开放式、设计导向的任务时效果更好,但在逻辑错误、竞态条件和API误用等问题上仍可能漏检。

独立开发者李默将Opus 5形容为一个“做事靠谱,但略有个性的同事”。实际体验中,其调试能力很强,整体远高于Opus 4.8,也是Fable 5额度耗尽后的合适替代品。但Opus 4时代形成的工作流和提示词不能直接迁移到 Opus 5,想获得明显提升,得了解新模型习惯,调整任务拆分、effort档位和验证方法。
李默提到,实用的是两个Beta功能直接改善了Agent开发体验:过去改一次工具列表整段缓存就作废,现在对话中途换工具也不会失效;API还可启用自动降级,被安全分类器拦截的请求会自动转交其他模型。
综合来看,Opus 5目前更像一名执行力强、愿意自查,但还需要磨合的同事。它适合生成代码、修复问题和完成边界清楚的工作,但在复杂规划、长周期自主任务和部分文字表达上,Fable 5仍有优势。
03.Anthropic需要一款更日常的旗舰模型
Anthropic最近在加快模型更新速度。
5月29日,发布Opus 4.8;6月10日,发布Fable 5和Mythos 5;7月1日,上线Sonnet 5;7月25日,发布Opus 5,不到两个月,Claude的主要产品线几乎更新了一遍。
在密集发布模型的情况下,行业对模型应该如何开放的分歧也在扩大。7月16日,月之暗面发布开放权重模型Kimi K3,性能被认为已接近前沿。几天后,OpenAI战略负责人在X上预测,华盛顿会围绕中国开放权重模型制造“监管风险”,这番话被广泛解读为对开源阵营的施压。
Opus 5发布当天,英伟达、Meta、微软等25家公司和机构联合发表公开信,呼吁美国政府不要过早限制开放权重模型,OpenAI、Anthropic和Google没有出现在签署名单中。
缺席不等于明确反对开放权重,但与开放权重相比,Anthropic确实更强调闭源、分级开放和风险控制。6月12日,美国政府对Fable 5和Mythos 5实施管制,两款模型一度全面下线。限制解除后,Fable 5恢复公开服务,安全限制更少的Mythos 5仍只向部分获批机构开放。
Opus 5的定位,正嵌在Anthropic这套“模型该如何开放”的策略里。它发现源代码漏洞的能力接近Mythos 5,将漏洞转化为实际攻击工具的能力却明显较弱。对 Anthropic 而言,它不只是更便宜的Fable 5替代品,也是一个更容易在合规框架下向普通用户和企业开放的选项。

与此同时,Anthropic还在扩充算力。Opus 5发布前两天,公司宣布将部署最高2吉瓦规模的AMD Instinct MI450系列GPU和Helios机架级系统,首批1吉瓦计划于2027年上半年开始部署。AMD还承诺未来向Anthropic进行最高50亿美元的战略股权投资。
从密集发布模型,到扩充芯片供给,再到精简系统提示词,Anthropic做的不仅是提高跑分,而是把模型能力拆分到不同价格、风险和使用场景中:Fable 5负责更复杂、更长周期的任务,Sonnet 5承接成本敏感的普遍需求,Opus 5则试图成为开发者和知识工作者的日常默认选择。
所以,Opus 5没有让Fable 5失去意义。后者仍代表Anthropic公开可用的模型能力上限,Opus 5解决的是如何以更低成本,把接近旗舰的能力交给更多用户。它的竞争力在于能否以更稳定的表现、更少的人工接管和可以控制的成本,把一项工作真正完成。
应受访者要求,李默为化名。


评论