“穷人的Fable 5”????Opus 5破晓突发,,网友吵翻
出品 | 网易智能
作者 | 辰辰
编辑 | 王凤枝
Opus 5在编程、知识事情和盘算机操作等多项测试中赢了Fable 5。。。。。
然后Anthropic说:这不是我们最好的模子。。。。。
北京时间7月25日破晓,,Anthropic宣布了Claude Opus 5。。。。。定价和上一代Opus 4.8持平:每百万输入token 5美元,,输出25美元,,是Fable 5的一半。。。。。
性能呢????
Frontier-Bench编程评测中,,Opus 5得分43.3%,,高于Fable 5的33.7%;;;;;;与Opus 4.8的18.7%相比,,则翻了一倍多,,单次使命本钱还更低。。。。。GDPval-AA知识事情评测,,Opus 5拿1861分,,Fable 5是1747分,,GPT-5.6是1736分。。。。。OSWorld 2.0盘算机使用测试、AutomationBench商业流程测试、Humanity's Last Exam带工具,,Opus 5所有凌驾Fable 5。。。。。在ARC-AGI 3上,,它的得分是第二名模子的三倍。。。。。
但无论是Anthropic的官方博客,,照旧产品治理认真人黛安·佩恩(Dianne Penn)接受CNBC采访时,,语言都极为准确:Opus 5只是“靠近”Fable 5的能力,,Fable 5仍然是“你最雄心勃勃的事情”该用的模子。。。。。一个在大大都科场里分数更高的学生,,被官方定性为“靠近”谁人分数更低的学生。。。。。
这不是话术失当。。。。。这是产品线的重新排位。。。。。
一、不是排行榜,,是分工表
要明确这件事,,先看Anthropic这两个月铺出来的模子矩阵。。。。。它不是从强到弱排下来的,,是按场景分的。。。。。
Mythos 5是网络清静和高风险科研偏向的专用模子,,能力最尖锐,,开放规模也最窄。。。。。曾触发美国政府以“国家清静”为由的出口管制,,被短暂下线两周。。。。。
Fable 5面向最重大、一连数天的自主使命。。。。。6月宣布时被Amazon研究职员发明可绕过清静护栏,,Anthropic于6月12日将其下架,,6月30日重新上线。。。。。它是Anthropic保存给“最雄心勃勃事情”的旗舰,,也是最贵的。。。。。
Opus 5面向日常编程、知识事情和企业智能体,,价钱更低,,适合高频使用。。。。。从Opus 4到4.8,,它一直是许多开发者心中“写代码最靠谱的模子”。。。。。但这一定位让它恰恰卡进了模子矩阵里最拥挤的一段。。。。。
Sonnet 5在7月1日宣布时定位“日常最高效”。。。。。Opus 5一出,,“日常”这个位置上突然泛起了两个选手。。。。。
ZDNET的谈论一针见血:“Sonnet 5被卡在一个尴尬的位置:夹在更自制但弱得多的Haiku 4.5,,和更强但更贵的Opus与Fable之间。。。。。”
而Opus 5宣布后,,Sonnet卡在Haiku和Opus之间,,Opus卡在Sonnet和Fable之间,,Fable卡在Opus和Mythos之间。。。。。
一位X用户说得很准:“Opus 5像是GPT-5.6和Fable 5之间的一个希奇但有用的中心态。。。。。它有Fable的品味,,又有GPT-5.6的彻底和较真。。。。。代码不如Fable写的漂亮,,但更可能是对的。。。。。”
二、一边拉胯,,一边封神
第一天的口碑泛起了有数的撕裂。。。。。但仔细看,,骂的人和夸的人说的着实是统一件事:Opus 5不是Opus 4.8的升级版,,它是一个需要重新顺应和学习的新模子。。。。。
Every联合首创人丹·希珀(Dan Shipper)的团队花了一周重复测试,,结论绝不留情:“一个很难让人爱上的模子。。。。。”
其中一句原话更狠:“穷人的Fable。。。。。它有Fable的许多性格怪癖,,但没有Fable的天才。。。。。”
希珀团队发明了两个反直觉的征象,,这两个征象指向统一个泉源:Opus 5的行为模式和旧模子完全差别,,不可当平替用。。。。。第一,,向后兼容性很差:把它塞进给旧模子写的skills和事情流里,,它会提前停下、遗漏指令,,甚至不配合。。。。。“删掉往事情流从零最先,,效果连忙好许多。。。。。”第二,,思索强度设得越低,,体现反而越稳固。。。。。“你给它越多时间思索,,它越容易出烦人的行为。。。。。”希珀的结论是:天才使命用Fable,,日常用GPT-5.6,,Opus 5只在Fable额度跑完时顶上。。。。。
一位西班牙用户在X上给Opus 5打了5分,,满分10分,,Fable 5他给8分。。。。。评语是“小模子的味道,,emoji太多”,,“看起来不像统一个模子家族的。。。。。”
名为VooStack的用户将这种征象称为“模子漂移债务”:“每发一个新模子就意味着重构提醒词。。。。。真正的蹊径图杀手。。。。。”
但另一边,,赞美同样强烈。。。。。
Cursor联合首创人苏阿莱·阿西夫(Sualeh Asif)说:“Opus 5以Opus的速率和本钱,,抵达靠近Fable 5的智能。。。。。在CursorBench上只差不到0.5%。。。。。”
执法AI公司Harvey的应用研究主管尼科·格鲁彭(Niko Grupen)给了更详细的数字:Opus 5在坚持质量的同时,,平均比Opus 4.8少天生26%的token。。。。。在公司治理和仲裁营业线上,,增幅最显着。。。。。
尚有更夸张的。。。。。一位用户在X上发视频:完全不会写代码,,靠Opus 5在15分钟内做出了三个可运行的外地网站原型。。。。。
另一个用户说Opus 5做了一个他“见过最好的火箭同盟克隆游戏”,,“车的反射、细节,,简直离谱”。。。。。
各人说的是统一款模子。。。。。分歧点不在于模子好欠好,,而在于你把它当什么用:当成Opus 4.8的即插即用替换品,,会翻车;;;;;;当成一个需要重新学习使用要领的新工具,,可能凌驾预期。。。。。
三、更偏防守
公正地说,,Opus 5在少数评测上确实不如Fable 5。。。。。内部执法智能体评测中Fable领先,,DeepSWE编程测试上Fable略高。。。。。在网络清静误差使用(把误差酿成实质性威胁)的能力上,,它被刻意留在Mythos 5之后。。。。。有机化学和卵白质设计上,,则是Opus系列最强。。。。。
这种差别来自训练阶段的选择,,而非护栏的松紧。。。。。
Anthropic在清静白皮书里坦率:Opus 5没有接受过网络清静使命的专门训练,,“由于通用能力变强了,,这个能力也随着水涨船高。。。。。”由于模子自己的攻击能力天花板就低,,清静护栏可以比Fable 5放得更宽,,分类器阻挡频率少了约85%。。。。。
但这不料味着不设防:二进制误差扫描、渗透测试和误差使用天生等高风险请求仍然会被阻挡。。。。。源代码级别的误差查找,,放行。。。。。
设计思绪很清晰:更偏防守,,不向通俗用户铺开进攻能力。。。。。
四、拆开“最好”
清静护栏的收窄是一笔账。。。。。定价和定位的收窄,,是另一笔账。。。。。
CNBC的报道点破了一个要害事实:“企业客户越来越关注本钱,,若是没有清晰的投资回报率画面,,就不肯意为腾贵模子买单。。。。。”
佩恩点到了问题的要害:“企业客户在寻找价值。。。。。若是一个模子更自制,,但达不到类似质量,,它着实没有用。。。。。”
翻译一下:我们不打价钱战。。。。。我们打价值战。。。。。
但Opus 5做的事,,比“价值战”更智慧。。。。。性能大幅提升,,价钱原地不动。。。。。对企业而言,,用同样的预算可以买到更多智能和更长的事情时间。。。。。另外,,Opus 5的一般会见不附带数据留存要求:企业不必为了获得靠近Fable的能力,,同时接受更高价钱和更敏感的数据条件。。。。。
曾在ZDNET评测中自称“重度Opus 4.8用户”的大卫·格维尔茨(David Gewirtz)说了一个细节:他用100美元的Claude Max订阅跑了整整一周的大规模智能体使命,,用量只到31%。。。。。“换Opus 5之后,,预计能做更多事。。。。。”
OpenAI同月宣布的GPT-5.6 Sol,,定价比Opus 5略贵,,每百万输出token 30美元。。。。。在Anthropic自己宣布的比照表中,,Sol只在DeepSWE一项编程测试上赢了Opus 5,,其他所有落伍。。。。。谷歌的Gemini模子则基础没泛起在内外。。。。。
按AI行业媒体The New Stack的说法:“显然,,Anthropic以为它们不配多占一列。。。。。”
节奏很清晰了:Anthropic不妄想靠价钱屠杀敌手,,它要做的事更细腻。。。。。
Mythos是最好的武器。。。。。只给经由审查的企业和研究者用。。。。。
Fable是最好的大脑。。。。。留给“最雄心勃勃的事情”,,留给那些“以前什么都做不了的、一连数天的自主项目”。。。。。
Opus是最好的工具。。。。。天天早上第一个翻开,,什么都醒目,,不专心疼token。。。。。
Opus 5卡在“够好”和“最好”之间。。。。。这个位置不是意外,,是Anthropic算过的。。。。。
文章点评
未盘问到任何数据!
揭晓谈论
◎接待加入讨论,,请在这里揭晓您的看法、交流您的看法。。。。。