全网骂Claude变笨,,Anthropic下场揭秘:坑你的不是模子
新智元报道
【新智元导读】换更大的模子就即是更智慧????这可能是Claude Code用户最深的误会。。。许多人为此一起换到最贵的Fable,,克日,,Anthropic,,亲手澄清了这个误区。。。
你有没有过这种时刻:Claude Code写代码写砸了,,第一反映,,就是赶忙换个更强的模子。。。
但这一招,,许多时间并不管用,,甚至是在白花钱。。。
克日,,Anthropic官方发了一篇长文专门来讲这件事。。。
因由是太多人把Claude Code里的两个选项搞混了:
一个是模子选择(Model),,一个是起劲度(Effort)。。。
已往,,各人对这两个选项的明确都很简朴:换更大的模子,,AI就更智慧;;;;;把Effort调高,,无非是让AI多想一会儿。。。
而就在今年3月,,这个误会还惹出了一场不小的杂乱。。。
其时,,不少开发者发明,,手里的Claude Code突然「变笨」了。。。该读的文件不读,,该跑的测试不跑,,使命干到一半就撂挑子,,反过来问你要更多信息。。。
于是,,GitHub上骂声一片。。。
最狠的一刀来自AMD的AI认真人Stella Laurenzo。。。
她在GitHub上翻出6852个会话的日志,,实测Claude的思索量比2月之前掉了67%,,撂下一句:
Claude已经没法被信任,,去干重大的工程活了。。。
早先,,各人还以为是自己的提醒词没写好,,或者那里设置错了。。。折腾半天才恍然大悟:问题基础不在自己身上,,是Anthropic悄悄改了一个设置。。。
3月4日,,为了压低延迟,,他们把Claude Code里的Effort选项,,默认档位从high降到了medium。。。
官方更新日志里也写了,,可大大都人并没注重到,,他们只是感受到,,手里的模子无缘无故似乎变蠢了。。。
扛了一个月,,Anthropic才在4月7日把默认档位调回去,,还给所有订阅用户重置了一次用量额度。。。
而大都人这时才知道,,这个开关一直就在自己手边,,它在漆黑决议着:AI究竟肯不肯为你满血干活。。。
Model换的是脑子
Effort换的是态度
Anthropic官方的拆解,,可以简朴总结为这样一句话:
Model换的是脑子,,Effort换的是态度。。。
先说Model,,它换的是脑子。。。
每个模子背后是一套「冻结的权重」,,它的能力和知识,,在训练竣事那一刻就被焊死了:只读、不可改。。。
这意味着,,你推理时喂进去的提醒词、CLAUDE.md、贴进上下文的代码,,全都改变不了它的这套权重:你可以指导它,,却没法「训练」它。。。
换模子,,实质就是换一整套权重来接你的活,,以是它解决的是「会不会」的问题。。。
一个在模子训练时还不保存的库,,你把文档整篇喂给它,,它能现学现用,,可那只对这一次请求管用,,模子自己一个字都没记。。。,转头就忘。。。
它无意会一本正经地挪用一个基础不保存的API,,也是统一个原理。。。那并非查漏了,,是权重照着训练里的老套路,,硬拼出一串工具。。。
再往底层看一眼,,就更清晰了。。。你写的const x = await fetch,,在模子眼里先被切成一个个token,,每个换成词内外的一个数字。。。
你写的一行代码,,被切成token后各自对应词内外的一个整数:const是1078,,await是2597,,词表约10万个。。。模子拿到的历来不是文字,,是这串数字。。。(图源:Anthropic官方博文)
模子不是一口吻吐出整段谜底的。。。它一次只展望一个token,,接上去,,再把整串重新算一遍,,展望下一个。。。一段两百个token的回复,,就是两百次完整的运算。。。
你等的时间、你烧的钱,,大头全在这个循环里。。。
再说Effort,,替换的是「态度」。。。
许多人以为高Effort就是「多想几秒」,,错了。。。
它管的是Claude在这次使命上究竟投入几多事情量:读几个文件、跑不跑测试、要不要特殊验证、要不要把一个多方法使命一起推究竟再回来找你。。。
说白了:低Effort的Claude,,倾向于快速回复,,然后反过来问你要更多上下文,,能不下手就不下手;;;;;高Effort的Claude,,倾向于自己去翻信息、多调一再工具、一口吻把长使命链跑完。。。
Effort在Claude Code里分成好几档,,别把它当成一条死板的token预算线。。。
它是个行为信号,,告诉Claude这活得干到多彻底、多有掌握才算完,,文本回复、工具挪用、扩展思索,,全在它的统领规模里。。。
官方还放了一张示意图:统一条prompt,,高Effort能比低Effort多吐约莫7倍的token。。。多出来的那些,,全花在读文件、跑验证、重复确认上了。。。
统一条prompt,,高Effort路径天生的token约为低Effort的7倍,,多出的全花在读文件、跑验证、重复确认上。。。(图源:Anthropic官方博文)
这里藏着一个反直觉的结论:小模子开高Effort,,完全可醒目翻大模子开低Effort。。。
照旧不敷起劲
知道了分工,,真正有用的,,是官方给的那套判断框架。。。
官方判断框架:Claude做错了,,先问它是不敷智慧照旧不敷起劲,,再决议换模子照旧加Effort。。。(图源:Anthropic官方博文)
Claude干砸了,,先别急着动模子选项。。。
第一步永远是转头查上下文:prompt说清晰了吗????该给的工具给了吗????CLAUDE.md配对了吗????大大都所谓「AI变笨」,,根子都在这儿,,不在模子选项上。。。
上下文确实没问题、它照旧错,,就问自己一句:它是不会,,照旧不敷起劲????
「不敷起劲」,,很好判断:该读的文件跳过了、测试没跑、重构干到一半跑回来问你:它缺的不是脑子,,是投入。。。
这是Effort的事,,可以往上调一档。。。
若是「不会」,,则是另一种情形:你上下文给足了,,它也显着起劲了,,可照旧错,,换个说法再试一遍照旧错。。。
这时间任你怎么加Effort都白搭,,这是模子的事:就要换更强的。。。
官方还打了个特殊好懂的例如。。。
Sonnet,,是个有一整个下昼的万能选手。。。
它会把你的代码重新读到尾,,跑一遍、再验一遍,,最后是真把你这摊活儿吃透了。。。
Opus,,是只给你五分钟的专家。。。它带来的是你代码库里压根没有的履历,,见过的坑、该绕的雷,,全是解过一堆同类问题攒下的直觉。。????晌宸种泳湍敲吹闶奔洌,只够它扫一眼,,不可扫遍所有文件。。。
Fable,,是所有人都卡住了才请得动的专科。。。哪怕只给五分钟,,它也能一眼揪出别人谁都没看出的那处误差。。。
虽然,,这位专家每个token也最贵,,得留给真正没人能接的硬骨头。。。
以是才有谁人反知识的结论:
一个Sonnet开高Effort,,在不少活儿上真醒目过Opus开低Effort。。。小模子配上富足上下文和高投入,,能扛下的事比你想象的要多得多。。。
长使命、多方法活上,,Fable拉开最大差别,,官方测试里有些使命Opus和Sonnet开到任何Effort都够不着。。。(图源:Anthropic官方博文)
卷完模子排行榜
给AI派活成了硬手艺
这篇官方解读,,外貌上是教你调参,,背后是一个主要的转向:
AI编程的竞争,,正在从「谁的模子更强」,,转向「谁更会调理智能体」。。。
已往很简朴,,人挑一个最强的模子,,剩下的全交给它。。。
现在纷歧样了。。。你得像个项目司理那样,,给差别的模子派差别的角色、定差别的投入档位:
简朴的改动交给Sonnet挂低档,,秒回还省钱;;;;;大型重构上强模子加高等;;;;;要长时间自己跑的智能体使命,,强模子配足Effort。。。
这些操作,,不但能把活干得更好,,省下来的,,都是真金白银的token账单。。。
Claude Code的Effort菜单里多出的那档ultracode,,就是把这套「调理」做进了产品。。。
选中它,,Claude拿到的是xhigh的火力,,外加一项授权:遇到实质性的活儿,,自己掂量要不要拉起一支智能体步队,,把使命拆下去并行干。。。
转头看3月那场「变笨」风浪。。。
它能惊动整个社区,,恰恰由于大大都人还停在「换模子」的老思绪里,,敌手边这个更要命的Effort选项浑然不觉。。。
只看模子排行的时代正在已往,,调理模子,,正在成为焦点手艺。。。
谁先学会给AI派活,,谁就能争先一步,,用上谁人真正肯为你认真的Claude。。。否则,,你手里再贵的模子,,也执偾一个更贵的搜索框。。。
这样,,你烧的每一分token,,才算真花在了刀刃上。。。
参考资料:
https://claude.com/blog/claude-model-and-effort-level-in-claude-code
https://x.com/ClaudeDevs/status/2074900291062034618?s=20
https://platform.claude.com/docs/en/managed-agents/multi-agent
编辑:元宇
@李仁杰:日博app官方,,王楚钦“打哭”小勒布伦@刘瑜吉:以总理称印度是小国朋侪
@王伟云:AI天生环卫工照片获摄影角逐一等奖
热门排行
- 1 真人国际艺术教育集团
- 2 1388ceo彩集困
- 3 w66体育
- 4 凯撒皇宫官网
- 5 二八杠玩法
- 6 东方赢家
- 7 银河国际有哪几个
- 8 聚宝盆224444
- 9 体球网官方线上