凯时AG

环球热门新闻资讯
2026-07-21 05:11:48
首页 > 新闻 > 时政要闻 > 正文

GPT-5.6正式宣布,,,Codex与ChatGPT合二为一

这两天,,,AI 行业迎来了一轮麋集的产品宣布。。 。。。。先是 xAI 宣布 Grok 4.5,,,继续强化其在编码和 Agent 场景上的竞争力;; ;; ;;后有 Meta 姗姗来迟,,,推出 Muse Spark 1.1,,,并首次向开发者开放 Model API,,,最先正面争取企业和开发者市场。。 。。。。

但就在这一轮竞争进入白热化之际,,,OpenAI 正式宣布 GPT-5.6 系列模子,,,并同步完成 ChatGPT 产品架构的一次主要调解,,,再次将行业关注点拉回自己身上。。 。。。。经由 12 天的政府审查与受限预览,,,OpenAI 于外地时间 7 月 9 日正式向全球用户开放 GPT-5.6 系列模子——Sol、Terra、Luna 三款同时上线。。 。。。。

(泉源:X)

与此同时,,,自力运行近一年的 Codex 应用正式并入 ChatGPT 桌面端,,,与新推出的 ChatGPT Work 智能体配合组成统一产品入口,,,整合了对话、编码以及长程使命执行等能力。。 。。。。这也是 OpenAI 自今年 4 月宣布 GPT-5.5 以来规模最大的一次产品更新,,,模子能力、产品架构和商业战略三条线同程序整。。 。。。。

政府审查竣事,,,GPT-5.6 正式周全开放

6 月 26 日,,,GPT-5.6 首次以受限预览形式上线,,,仅向约 20 家通过美国政府审查的相助机构开放。。 。。。。据多家媒体报道,,,白宫国家网络清静总监办公室(ONCD)和科技政策办公室(OSTP)以为,,,旗舰模子 Sol 已具备较强的网络清静能力,,,因此要求 OpenAI 在正式宣布前完成特殊清静评估。。 。。。。

官方数据显示,,,Sol 在内部网络攻击评测中的得分抵达 96.7%,,,在 ExploitBench 误差使用基准上的效果也从 GPT-5.5 的 47.9% 提升至 73.5%。。 。。。。美国商务手下属 AI 标准与立异中心(CAISI)加入了手艺评审,,,OpenAI 工程师也前往华盛顿与政府部分举行了手艺交流。。 。。。。

虽然整个流程仍属于企业自愿加入,,,但从外界来看,,,美国政府已经最先形成针对前沿 AI 模子"宣布前评估"的治理框架。。 。。。。关于未来能力更强的基础模子而言,,,这种清静审查机制很可能逐渐成为行业常态。。 。。。。

不再卷"最强",,,而是卷"最划算"

此次 GPT-5.6 家族接纳了全新的命名系统。。 。。。。

Sol 定位旗舰模子,,,Terra 主打性能与本钱平衡,,,Luna 则面向更高性价比场景,,,名称划分来自拉丁语中的太阳、大地和月亮。。 。。。。数字代表模子代际,,,Sol、Terra、Luna 则成为恒久保存的能力层级,,,未来可以划分自力迭代。。 。。。。

价钱系统也体现了这一思绪。。 。。。。Sol 每百万 Token 输入价钱为 5 美元、输出 30 美元;; ;; ;;Terra 划分降至 2.5 美元和 15 美元;; ;; ;;Luna 则进一步降低至 1 美元和 6 美元。。 。。。。OpenAI 同时调解了 Prompt Cache 的计费方式,,,缓存写入按标准输入价钱的 1.25 倍收费,,,读取价钱享受折扣,,,并支持开发者手动设置缓存断点,,,使恒久运行的 Agent 本钱越发可展望。。 。。。。

从官方宣布的数据来看,,,GPT-5.6 的焦点卖点并不是绝对性能,,,而是性能、速率和本钱之间的综合平衡。。 。。。。

在 Artificial Analysis 编程智能体指数上,,,Sol 获得 80 分,,,凌驾 Claude Fable 5,,,同时输出 Token 数目不到后者的一半,,,运行时间缩短约一半,,,整体本钱约低三分之一;; ;; ;;Terminal-Bench 2.1 和 DeepSWE 等编码使命也取适目今最佳效果。。 。。。。Terra 和 Luna 划分凌驾 Claude Fable 5 与 Claude Opus 4.8,,,在速率和本钱方面同样具有显着优势。。 。。。。

不过,,,在综合推理能力上,,,Anthropic 依然坚持领先。。 。。。。在 Artificial Analysis 综合智能指数中,,,GPT-5.6 Sol 得分 59,,,仍低于 Claude Fable 5;; ;; ;;SWE-Bench Pro 软件工程评测中,,,Sol 为 64.6%,,,而 Claude Fable 5 和 Mythos 5 均凌驾 80%;; ;; ;;FrontierMath Tier 4 数学测试中,,,Sol 的效果甚至低于 GPT-5.5。。 。。。。

这也反映出 OpenAI 此次产品战略的转变。。 。。。。相比追求每一项基准测试都坚持第一,,,GPT-5.6 更强调开发者最常使用的编程、Agent 和企业应用场景,,,在包管能力的同时进一步压低推理本钱和响应时间。。 。。。。

围绕这一目的,,,GPT-5.6 还加入了几项新的能力。。 。。。。

Ultra 模式允许多个智能体并行事情,,,默认启动 4 个 Agent,,,最多可扩展至 16 个,,,以更多盘算资源换取更好的效果;; ;; ;;Max 模式则给予模子更长思索时间,,,提高重大推理使命的稳固性。。 。。。。

API 层面推出的 Programmatic Tool Calling 也值得关注。。 。。。。已往,,,开发者需要在应用层设计重大的工具挪用流程;; ;; ;;现在模子可以自行编写程序,,,对工具举行调理、处理暂时数据并组织执行流程,,,从而进一步降低重大 Agent 的开发本钱。。 。。。。

Codex 并入 ChatGPT

模子之外,,,OpenAI 对产品系统也举行了近年来最大规模的一次整合。。 。。。。

从 7 月 9 日最先,,,自力运行近一年的 Codex 正式并入新版 ChatGPT 桌面应用。。 。。。。新版应用提供 Chat、Work、Codex 三种模式,,,用户无需切换差别软件,,,即可完成日常对话、代码开发和长时间重大使命。。 。。。。

原有 Codex 用户可以保存项目、设置和事情流,,,也可以继续使用 Codex 图标或将其设为默认视图;; ;; ;;此前的 ChatGPT 桌面应用则更名为 ChatGPT Classic。。 。。。。与此同时,,,自力 Atlas 浏览器阻止更新,,,其智能体浏览能力被整合至 ChatGPT Chrome 扩展。。 。。。。

(泉源:OpenAI)

事实上,,,这一整合早已有迹?????裳。 。。。。今年 5 月,,,OpenAI 已将 ChatGPT 消耗产品团队与 Codex 团队合并,,,由联合首创人 Greg Brockman 统一认真产品研发。。 。。。。

更直接的原因则来自用户行为。。 。。。。OpenAI 披露,,,Codex 每周活跃用户已凌驾 500 万,,,其中凌驾 100 万人并非用于编程,,,而是在处理文档、剖析资料、妄想项目等通用事情。。 。。。。

在这一配景下,,,OpenAI 还同步推出了 ChatGPT Work。。 。。。。它能够跨多个应用网络上下文信息,,,将重大目的拆分为多个方法,,,并一连事情数小时,,,最终天生文档、电子表格、演示文稿以致可直接分享的网页应用。。 。。。。相比古板谈天机械人,,,它更靠近一个能够恒久执行项目的智能体。。 。。。。

这一系列调解也意味着,,,OpenAI 正在逐步放弃多个自力 AI 产品并行生长的思绪,,,而是希望将 ChatGPT 打造成所有 AI 能力的统一入口。。 。。。。

宣布会上尚有一个细节引发不少关注。。 。。。。OpenAI 透露,,,GPT-5.6 家族中最小的 Luna 模子,,,厥后训练流程已完全由旗舰模子 Sol 自主完成,,,包括寻找可用 GPU、确定训练设置、编写启动剧本以及确认使命执行等全历程。。 。。。。与此同时,,,OpenAI 体现,,,已往六个月内部用于代码推理研究的盘算资源增添约 100 倍,,,智能体 Token 使用量增添约 22 倍,,,并首次果真了权衡 AI 自主研发能力的 RSI(递归自我刷新)指数,,,GPT-5.6 Sol 相比 GPT-5.5 提升了 16.2 分。。 。。。。

这些数据批注,,,AI 已不但是在资助开发者写代码,,,也最先越来越多地加入下一代 AI 系统自身的研发流程。。 。。。。

参考链接:https://openai.com/index/gpt-5-6/

从“海洋鉴赏地”到“全球海洋文化舞台”

责任编辑:黄佩芳

【网站地图】