凯时AG

GPT-5.6宣布之夜 ,,,,,,Codex/ChatGPT合二为一

作者:陈伟伦
宣布时间:2026-07-21 06:55:28
阅读量:82

GPT-5.6宣布之夜 ,,,,,,Codex/ChatGPT合二为一

智能体时代的 ChatGPT ,,,,,,想成为你电脑里常驻的那一层。。。

作者|张勇毅

北京时间 7 月 10 日破晓 ,,,,,,GPT-5.6 面向公众周全开放。。。这件事自己没什么悬念。。。事实跑分 6 月尾就果真了 ,,,,,,价钱早就挂了出来 ,,,,,,所有人等的只是一个「开闸」日期。。。

同样值得关注的 ,,,,,,是统一晚被模子光环盖住的另外两条通告:一个叫 ChatGPT Work 的智能体产品 ,,,,,,以及 Codex App 正式并入 ChatGPT 桌面应用。。。

模子宣布是各人都等的那只靴子 ,,,,,,这两条才是 OpenAI 藏在靴子里的工具。。。

准期而至的 5.6

和此前果真的一样 ,,,,,,GPT-5.6 分三档:旗舰 Sol(太阳)、平衡型 Terra(地球)、轻量型 Luna(月亮)——数字代表世代 ,,,,,,天体名代表档位 ,,,,,,也代表以后各档可以按自己的节奏迭代。。。

按每百万 token 计 ,,,,,,Sol 输入 5 美元、输出 30 美元 ,,,,,,与上一代 GPT-5.5 持平 ;;;;;;Terra 直接砍半 ;;;;;;Luna 压到 1 美元和 6 美元。。。

OpenAI 给后两档的定位着实也很是明确:Terra 在知识事情评测中以更低本钱凌驾 GPT-5.5 ;;;;;;Luna 用不到一半的预估本钱 ,,,,,,迫近 GPT-5.5 的峰值体现。。。

从这点也能看出。。。 ,,,,,,这次宣布的主叙事不是「更智慧」 ,,,,,,是「更省」。。。

在第三方评测机构 Artificial Analysis 的编程智能体指数上 ,,,,,,开满 max 推理的 Sol 以 80 分创下新高。。。价钱却更低:比此前最高分的模子少用 54% 的输出 token ,,,,,,耗时缩短 57%。。。

拼智商的边际收益在收窄 ,,,,,,前沿模子最先拼单位使命本钱了。。。

另一块值得单说的是设计。。。前端一直是 OpenAI 被公认落伍的短板 ,,,,,,Altman 在 GPT-5.5 宣布时亲口认可过这一点。。。

这次官方宣称设计判断力有了一次跨越:只给一句高层指示 ,,,,,,模子就能产出得体、能用的界面——更要害的是机制变了 ,,,,,,借助更强的电脑操作能力 ,,,,,,它会自己翻开渲染出来的页面 ,,,,,,检查视觉和功效上的问题、补完细节再交稿 ,,,,,,而不是写完代码就算完。。。

把「看过制品才交付」这个人类工程师的验收习惯装进模子 ,,,,,,比跑分上涨更能说明这一代的偏向。。。 第三方的背书也跟上了:一家评测同伴给它的前端质量评分是 4.4 分 ,,,,,,GPT-5.5 是 4.0 ;;;;;;Canva 说它做幻灯片强于同类模子 ,,,,,,token 效率还横跨 1.6 倍

API 里还塞了两个给开发者的新工具。。。一个是程序化工具挪用:模子自己写一段 JavaScript ,,,,,,在托管的隔离运行时里编排整条工具链。。。

另一个是多智能体:单次请求内并行派生多个子智能体 ,,,,,,现在在 Responses API 以 beta 开放。。。加上可显式声明断点的缓存机制 ,,,,,,偏向是一致的:把编排的活儿从开发者手里收进模子手里。。。

早期测试者对 Sol 和 Fable 5 各有拥趸 ,,,,,,「保时捷对曲速引擎」的比喻撒播很广。。。前沿模子的差别 ,,,,,,已经小到要用口胃而不是代差来形容了。。。

收进一个 App

模子是这一晚的体面 ,,,,,,里子尚有接下来这两件事。。。

先说 ChatGPT Work。。。它不是一个新的谈天模式 ,,,,,,是一个交付效果的智能体。。。

给它一个目的 ,,,,,,它自己拆解方法、跨应用跨文件地行动、一连事情数小时。。。最后给你的不是一段建议 ,,,,,,而是做完的表格、幻灯片、文档 ,,,,,,甚至一个可以分享链接的网页应用。。。

通过插件接入 Slack、Teams、Google Drive、邮箱、日历和 CRM ,,,,,,用「@」指定它去哪个应用里取上下文。。。配合准时使命 ,,,,,,它可以每周一早上把群里的讨论整理成聚会议程 ,,,,,,或者盯着反馈邮箱、一有新邮件就更新汇报文稿。。。桌面版还内置了浏览器 ,,,,,,配合 Computer Use ,,,,,,它可以直接上手操作你的电脑 ,,,,,,去完成那些没有 API 可调的活儿。。。

第三条能力线则是浏览和操作电脑。。。Sol 在测试网页深度检索的 BrowseComp 上以 92.2% 创下新纪录 ;;;;;;在模拟真实电脑操作的 OSWorld 2.0 上拿到 62.6% ,,,,,,凌驾了 Anthropic 的 Opus 4.8——并且只用了对方 15% 的输出 token。。。

这两个数字诠释了 Work 敢允许「一连事情数小时」的底气从哪来 ,,,,,,也把「省着干活」的主线又坐实了一遍。。。

支持这一切的底座是 Codex。。。OpenAI 在博客里给了一组数字:每周有凌驾 500 万人使用 Codex ,,,,,,其中凌驾 100 万人用它做的基础不是软件开发。。。

一个编码智能体 ,,,,,,五分之一的用户拿它干别的——这就是 OpenAI 敢把它升格为通用事情智能体的底气。。。 写代码需要的那套能力——明确目的、拆解使命、挪用工具、检查效果、自己纠错——恰恰就是干任何知识事情需要的能力。。。Codex 不是被替换了 ,,,,,,是被泛化了。。。

这条路 ,,,,,,Anthropic 半年前就走过一遍:今年 1 月 ,,,,,,Claude 桌面应用里泛起了第三个标签页 Cowork——用 Claude Code 的智能体架构做编码之外的知识事情 ,,,,,,和 Chat、Code 并列 ;;;;;;就在 ChatGPT Work 宣布前两天 ,,,,,,它刚扩展到网页和移动端。。。

Anthropic 同期宣布的数据甚至提前验证了 OpenAI 的判断:120 万次 Cowork 会话里 ,,,,,,占比最高的是对账、做报表这类营业流程事情 ,,,,,,写代码只占 8.7%。。。

区别在入口的激进水平——Cowork 至今是付费功效 ,,,,,,OpenAI 则是直接把 Work 直接放进了免费版。。。

然后是入口。。。Codex App 从今天起并入新的 ChatGPT 桌面应用 ,,,,,,Chat、Work、Codex 三个模式装进统一个 App ,,,,,,macOS 和 Windows 全球开放下载 ,,,,,,所有档位可用——包括免费版 ;;;;;;旧版桌面应用更名为 ChatGPT Classic。。。

老用户的项目、设置、事情流所有保存 ,,,,,,可以把 Codex 设为默认视图 ,,,,,,macOS 上连图标都能继续用原来的。。。合并的同时 ,,,,,,Codex 还带来一批实打实的更新:在应用里内联编辑 Markdown 和代码 ,,,,,,在侧边栏审 GitHub PR、评审意见和 diff 摆在一起看 ,,,,,,单个项目支持多个客栈。。。Computer Use 在 GPT-5.6 加持下也更快了。。。

博客末尾还藏着一条新闻:自力的 Atlas 浏览器将逐步停役 ,,,,,,浏览器侧的能力改由更新后的 Chrome 扩展承接 ,,,,,,住进 Chrome 的侧边栏。。。

把这几件事连起来看:Codex 并进来 ,,,,,,Atlas 撤出去 ,,,,,,Chrome 扩展贴上来。。。模子在 API 里打价钱战 ,,,,,,产品在桌面上打入口战——OpenAI 想让「电脑上谁人能替你下手干活的工具」只有一个名字。。。

谈天框时代的 ChatGPT 是浏览器里的一个标签页 ,,,,,,智能体时代的 ChatGPT ,,,,,,想成为你电脑里常驻的那一层。。。

对通俗用户 ,,,,,,最现实的转变是门槛。。。Work 和 Codex 随桌面 App 对所有档位开放 ,,,,,,免费版也在其中 ;;;;;;网页和移动端从 Pro、Enterprise 和教育版最先推送 ,,,,,,Plus 和 Business 随后几天跟上。。。一个此前只属于开发者和重度付用度户的工具 ,,,,,,一夜之间放到了所有人眼前。。。

ChatGPT 桌面 App 中并列的 Chat、Work 与 Codex 入口|图片泉源:OpenAI 官网

禁令余波

最后照旧得说回一件更大的事——这次宣布的日期 ,,,,,,不是 OpenAI 自己定的。。。

6 月 2 日 ,,,,,,特朗普签署行政令 ,,,,,,要求 AI 公司在周全宣布前向政府提供前沿模子做能力评估。。。

6 月 26 日 GPT-5.6「宣布」 ,,,,,,但应政府要求 ,,,,,,只向约 20 家报备过的机构开放。。。商务手下属的 AI 标准与立异中心评估了两周 ,,,,,,7 月 8 日放行 ,,,,,,才有了今天的周全开放。。。

引来审查的是 Sol 在网络清静和生物领域的能力——OpenAI 的系统卡片写得坦率:它能找到误差和攻击的「零件」 ,,,,,,但在测试条件下没能自主拼出一条完整的攻击链。。。

管控也下沉到了产品层。。??⒄咝胫镄疵鳎翰糠 API 挪用可能被阻挡 ,,,,,,甚至在天生到一半时被暂停 ,,,,,,交给清静系统做特殊审查。。。尤其在网络清静领域——防御和攻击 ,,,,,,初看起来一模一样。。。但护栏的力度是量化过的:新的网络清静防护阻挡的潜在有害活动约为上一代的十倍。。。

OpenAI 知道这会误伤正常使用 ,,,,,,于是留了个逃生门——在 ChatGPT 和 Codex 里 ,,,,,,被拦下的请求可以一键换低能力模子重试 ,,,,,,护栏严了十倍 ,,,,,,钥匙照旧塞回了用户手里一把。。。

OpenAI 配合了 ,,,,,,但官方声明同时也写道:「我们不以为这种政府准入流程应该成为恒久默认。。。」并且它不是孤例——几周前 ,,,,,,Anthropic 的 Fable 5 和 Mythos 5 因一纸出口管制指令下架 ,,,,,,Fable 5 已经恢复 ,,,,,,Mythos 5 至今只对一小批美国机构开放。。。

两家最头部的 AI 公司在一个月内先后履历「模子做好了、但不可随便卖」 ,,,,,,或许这不是巧合 ,,,,,,而是新常态的起源。。。

Sam Altman 在国会山会晤后接受媒体采访的现场照片|图片泉源:CNBC

围绕审查机制的博弈还在继续。。。但对坐在电脑前的你我来说 ,,,,,,这一晚更值得记着的可能是另一件事

从今天起翻开谁人 App ,,,,,,内里坐着的不再只是一个会谈天的框 ,,,,,,而是一个问你「要不要我把这活儿干了」的同事。。。

*头图泉源:视觉中国

本文为极客公园原创文章 ,,,,,,转载请联系极客君微信 geekparkGO

极客一问

你会让 AI 直接操作你的电脑替你干活吗??

 

文章点评

未盘问到任何数据!

揭晓谈论

◎接待加入讨论 ,,,,,,请在这里揭晓您的看法、交流您的看法。。。

最新文章

热门文章

随机推荐

【网站地图】