凯时AG

2026-07-22 02:28:21 设为首页 | 加入珍藏

GPT-5.6中档模子封神 ,,最贵版尴尬翻车

2026-07-22 02:28:21 宣布 泉源:CCTV5 作者:平哲孝 浏览:9732次

出品 | 网易智能

作者 | 辰辰

编辑 | 王凤枝

OpenAI说 ,,GPT-5.6的要害词是"效率"。。。 。

社区测了一天 ,,算出了三个谜底。。。 。

Terra意外出圈;;;;;;Sol稳 ,,但谈不上革命;;;;;;最耗资源的Ultra ,,却在一组物理测试里花了GPT-5.5三倍的钱 ,,效果还更差。。。 。

7月10日 ,,OpenAI周全开放GPT-5.6系列:Sol、Terra和Luna。。。 。一起上线的尚有ChatGPT Work ,,OpenAI把Codex的部分能力带进ChatGPT桌面端 ,,直接对标Claude Cowork。。。 。

两周前 ,,GPT-5.6还因网络清静问题 ,,只向少数经美国政府批准的机构开放。。。 。

现在限制扫除 ,,用户只体贴一件事:

多花出去的token ,,究竟有没有换来更好的效果?????

一、被低估的谁人

第一波体验中 ,,一个容易被忽略的名字最先泛起:Terra。。。 。

有人用Terra跑了钟表制造测试 ,,天生完整的瑞士杠杆擒纵机构三维模子。。。 。真实的齿轮比、可事情的擒纵、呼吸式游丝 ,,指针真的在走时。。。 。然后它自己检查了力学和视觉接触点 ,,重复迭代直到整个机芯稳固。。。 。

评测者的原话:"感受很是靠近 Mythos级别的模子。。。 。"

Terra 的官方定价:输入每百万 token 2.5美元 ,,输出15美元。。。 。按 OpenAI 官方估算 ,,在考察长程专业事情流的 Agents' Last Exam 中 ,,Terra 和 Luna 以约十六分之一的本钱凌驾了 Fable 5。。。 。

这不是 Sol。。。 。这是中心那档。。。 。

Notion 联合首创人西蒙·拉斯特(Simon Last)在官方通告中的评价更直接:"许多跑在 GPT-5.5上的智能体 ,,换到 Terra 上体现一样好 ,,本钱减半 ,,token 消耗少16%。。。 。"

对 Sol 自己的评价 ,,社区要冷静得多。。。 。

手艺大 V Jun Song 是活跃在 X 上的开源 AI 开发者 ,,他的总结被大宗转发:"不是 Fable 那样的全新架构。。。 。只是基于 GPT-5.5的一次扎实升级。。。 。三个月等来的更新 ,,谈不上革命。。。 。"但他加了一句:"仍然是订阅妄想里能用到的最好的模子。。。 。"

另一个撒播更广的比喻来自 Every 公司的联合首创人兼 CEO 丹·希珀(Dan Shipper) ,,他发帖称:"GPT-5.6像保时捷 ,,Fable 5像曲速引擎。。。 ?????缧窍涤 Fable。。。 。日常通勤用5.6。。。 。"

前端设计有这样一个详细数字。。。 。在 Triple Whale 的七项基准测试中 ,,Sol 得分4.4 ,,GPT-5.5是4.0 ,,Claude 4.8是3.5。。。 。从电商页面到仪表盘 ,,一连交付完整、响应式的界面。。。 。每一项都恰恰够好。。。 。这恰恰是"日常通勤"所需要的:不是最快的车 ,,是最不会让你迟到的车。。。 。

这是一个比"倾覆性"更忠实的定位。。。 。Sol 不是来推翻 Fable 的。。。 。它是来让更多人在更多场景下用得起够好的 AI。。。 。

听起来像是精准的市场定位。。。 。

更准确地说 ,,OpenAI 没有在所有场景里和 Fable 硬拼极限能力 ,,而是把重点放在性能、速率和本钱的平衡上。。。 。

但也有人差别意 Terra 的好评。。。 。有用户看了 Artificial Analysis 的性价比曲线图后直接谈论:"看不出用 Terra 的理由。。。 。Luna 或 Sol 在整条线上都是更好的选择。。。 。"

二、Ultra 的翻车现场

若是 GPT-5.6的故事到此为止 ,,它是清洁的。。。 。效率提升 ,,定位清晰 ,,社区大都人颔首。。。 。

但至少在一组 HTML5物理演示测试里 ,,Ultra 翻车了。。。 。

Atomic Chat 项目团队跑了一组 HTML5物理演示测试。。。 。四个模子 ,,统一个提醒词:天生三个自包括的物理场景 ,,怪物卡车后空翻落车顶、特技车飞跃六辆大巴撞墙、火车脱轨坠桥入水。。。 。

效果如下:

三倍的价钱。。。 。更差的效果。。。 。

依据这个账单 ,,测试者的结论不留人情:"Sol Ultra 绘图跟 GPT-5.5一样 ,,只是细节更多。。。 。物理真的变弱了。。。 。实质上是 GPT-5.5加更弱的物理和更悦目的画面 ,,收你三倍的钱。。。 。"

OpenAI 对 Ultra 的界说是"协调多个智能体并行事情" ,,默认四个智能体同时跑 ,,用更多 token 换更强效果和更快交付。。。 。

逻辑上说得通。。。 。

但物理测试揭开了逻辑裂痕:多智能体协调自己消耗 token。。。 。若是协调没有让最终输出更好 ,,用户就是在花钱买更多内部讨论 ,,而不是更好的效果。。。 。

AI 领域意见首脑罗翰·保罗(Rohan Paul)转述了这项测试 ,,并增补了手艺诠释:"物理演示袒露了通俗编码基准隐藏的弱点。。。 。一个模子可以花更多 token 形貌更富厚的场景 ,,却仍在难的部分失败:维持力、动量、碰撞时机和跨帧的可信物体行为。。。 。"

虽然 ,,需要说明的是 ,,这组测试选的是物理模拟 ,,一个需要全局一致性的使命类型。。。 。Ultra 的多智能体架构在可拆分的并行使命上可能体现差别。。。 。但物理测试恰恰袒露了它的结构性弱点:当使命不可拆分时 ,,更多智能体不即是更好效果。。。 。

并且烧掉的更多 token ,,是用户在付钱。。。 。

三、模子还没用熟 ,,下一代听说已经来了

GPT-5.6宣布当天 ,,X 上已经最先撒播 GPT-6可能很快到来的新闻。。。 。相关听说尚未获得 OpenAI 确认 ,,其宣布时间和手艺蹊径也都没有可靠结论。。。 。

但听说自己仍然击中了开发者的一种真实焦虑:模子迭代越来越快 ,,为一个新模子调解提醒词、参数和事情流之后 ,,这套适配事实能使用多久?????

一位用户问:"人们还没时间真正用上5.6 ,,已经在谈6了。。。 。这不就让整个5.6系列显得毫无意义?????"

这个判断未必公正。。。 。新模子泛起 ,,也不料味着旧模子连忙失去价值。。。 。

但对企业来说 ,,模子效率不可只算每百万 token 的价钱。。。 。切换模子、重新测试界线、修改提醒词和迁徙事情流 ,,同样都是本钱。。。 。

模子省下的钱 ,,只有在它被稳固使用足够长时间后 ,,才真正算数。。。 。

四、效率牌 ,,打给谁看

GPT-5.6的效率故事 ,,有两个观众。。。 。

一个是开发者社区。。。 。他们在跑分、比价、算性价比。。。 。结论是破碎的。。。 。Ultra 不值 ,,Sol 够用 ,,Terra 吵得最凶。。。 。有人说它靠近 Mythos ,,有人说它在性价比曲线上没有保存理由。。。 。两种判断同时建设 ,,由于测的不是统一件事。。。 。

另一个是华尔街。。。 。

OpenAI 已神秘提交 IPO 招股书。。。 。CNBC 和《纽约时报》的最新报道显示 ,,其私募市场估值约为8520亿美元 ,,并且 OpenAI 正在追求1万亿美元的 IPO 估值。。。 。Anthropic 在5月完成新一轮融资 ,,据《卫报》其时的报道 ,,估值抵达9650亿美元 ,,由此成为全球最有价值的 AI 公司。。。 。两家都在抢上市窗口。。。 。

"更好或持平 ,,但更自制" ,,这是说给企业 CFO 听的 ,,不是说给开发者听的。。。 。 CFO 体贴单位智能本钱 ,,开发者体贴极端场景下的体现。。。 。两种人体贴的不是统一件事。。。 。

而在 GPT-5.6宣布当天 ,,三个外围行动让"效率"这张牌更显拥挤。。。 。

GPT-5.6宣布后 ,,Anthropic 也宣布调解 Claude 的周度费率。。。 。有用户将这一时间点解读为对 OpenAI 新行动的回应。。。 。

科技剖析师、AI 领域大 V 金·艾森伯格(Kim Isenberg)的说辞一针见血:"态度很明确了。。。 。"

Meta 同日宣布 Muse Spark 1.1。。。 。SpaceX 前一天发了 Grok 4.5。。。 。统一周 ,,四家公司有大行动。。。 。

效率不是 OpenAI 的独家故事。。。 。它是全行业的价钱战。。。 。 OpenAI 说"我们效率高" ,,翻译一下:别去找更自制的替换品。。。 。

GPT-6的幽灵在上面飘着。。。 。你刚买的模子 ,,可能下个月就过时了。。。 。效率是时间的函数 ,,你得用够久 ,,省下的钱才算数。。。 。

五、那道线

回到社区评测。。。 。

把24小时的数据放在一起看 ,,GPT-5.6的画像比官方博客重大 ,,也更忠实。。。 。

第一 ,,Terra 是最被低估的一款。。。 。 靠近 Mythos 级的体现 ,,十六分之一的价钱。。。 。若是 OpenAI 的定价让你疑心 ,,为什么 Terra 夹在 Sol 和 Luna 中心似乎没有保存感 ,,Terra 的保存自己就是诠释。。。 。它证实晰效率提升是真实的 ,,只是不在你最先关注的谁人型号上。。。 。

第二 ,,Sol 是清静的选择 ,,不是革命的选择。。。 。 "保时捷不是曲速引擎"被撒播得这么快 ,,由于它精准地绕过了官方叙事的强调 ,,给了一个用户能用的定位:日常通勤的最优解。。。 。

第三 ,,Ultra 的物理测试至少袒露了一个问题:多智能体并行并不会自动带来更好的效果。。。 。 在需要维持统一物理规则和跨帧一致性的使命里 ,,协调本钱可能抵消并行收益。。。 。这不是对多智能体蹊径的否认 ,,而是提醒用户:Ultra 适合什么使命 ,,仍需要按场景验证。。。 。

第四 ,,GPT-6的幽灵悬在整个5.6系列上空。。。 。 这是效率叙事最深的矛盾:你告诉我这个模子很省、很值 ,,但我也知道你可能下个月就让它过时。。。 。

社区翻完 GPT-5.6的第一天账单 ,,谜底不是"好"或者"坏"。。。 。

而是统一个"效率" ,,在差别使命里算出了差别效果。。。 。

OpenAI 算的是基准效果、token 消耗和预估本钱;;;;;;开发者算的是详细使命能不可一次做对;;;;;;企业最终要算的 ,,则是切换模子、重新适配和恒久运行之后的总账。。。 。

GPT-5.6的效率提升是真的。。。 。但它不是统一的、周全的 ,,也不是换上新模子就会自动兑现。。。 。

Terra 在部分事情流里显示出了很强的性价比;;;;;;Sol 提供了更稳妥的性能与本钱平衡;;;;;;Ultra 则需要更挑使命 ,,多花的 token ,,必需换来足够好的效果 ,,才算效率。。。 。

归根结底 ,,模子变得更自制 ,,不即是使命一定做得更省。。。 。

真正有意义的效率 ,,仍然只有一种:花更少的钱 ,,把事情做完 ,,还不必返工。。。 。

画家把手中的颜料放入(tiáo)色盘 ,,精准调(tiáo)整比例 ,,以缤纷的色彩绘就优美画卷;;;;;;南水北调(diào)工程合理调(diào)动一切可以使用的资源 ,,自动改变水道 ,,使自然更好地造福人类。。。 。调 ,,一字双音 ,,既有顺势而为的选择 ,,又有不拘一格的创立。。。 。

责任编辑:李颖治    校对:赖凯元

今日热门

  1. 天下人民法庭5年审结种种案件3400万件
  2. 美军中央司令部称:海上封锁一连 已累计影响123艘船只
  3. 国台办:民进党政府刻意编造“大陆很危险”假话早已不攻自破
  4. 北京车展现场国产“超跑”秒售罄
  5. 当你收到台风预警 ,,该怎么做?????
  6. 武契奇今起对中国举行国是会见
  7. 新疆塔城:端午节戍边民警巡逻路上吃粽子
  8. 爆发爆炸事故的山西沁源注重峪煤矿为高瓦斯矿井
  9. 特朗普称霍尔木兹海峡不归任何人管 对阿曼发出忠言
  10. 借APEC春风链接亚太:成都将启动全球招商吸引外资

相关推荐

【网站地图】